Skip to content

Best for agents

Ranked by APEX-Agents - long-horizon professional tasks performed by agents.

Ranked by APEX-Agents - long-horizon professional tasks performed by agents. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
1Claude Sonnet 5.5NEWAnthropic · +1 variant———1M$4.00
2Claude Opus 5.5NEWAnthropic———1M$8.00
3Claude Fable 5.1NEWunknownAnthropic · +1 variant—————
4Gemini 3.7 FlashunknownGoogle—————
5Claude Opus 5Anthropic162.793.973.61M$10.00
6Grok 4.6unknownxAI—————
7GPT-6 AstraNEWunknown thinkingOpenAI—————
8Gemini 3.8 FlashNEWunknownGoogle—————
9Claude Fable 5Anthropic163.685.969.71M$20.00
10GPT-5.6 TerraOpenAI159.393.369.61.05M$4.50
11Muse Spark 1.3NEWunknownMeta—————
12GLM-5.3unknown thinkingZ.ai (Zhipu AI)—————
13Grok 4.5unknown thinkingxAI—————
14GPT-5.5unknown thinkingOpenAI—————
15Claude Sonnet 5unknown thinkingAnthropic—————
16GPT-6 SolNEWOpenAI———1.05M$4.00
17GLM-5.3-FlashunknownZ.ai (Zhipu AI)—————
18GPT-5.4unknown thinkingOpenAI—————
19GPT-5.6 Sol (pro, max)OpenAI—————
20Kimi K3unknownMoonshot AI—————
21Claude Opus 4.7Anthropic156.486.4—1M$10.00
22Claude Opus 4.8Anthropic158.391.059.01M$10.00
23DeepSeek V4 Pro 0813unknownDeepSeek—————
24Gemini 3.6 FlashGoogle154.494.146.71.05M$1.50
25Claude Opus 4.6Anthropic155.488.4—1M$10.00
26GPT-6 LunaNEWOpenAI———1.05M$0.20
27Claude Sonnet 4.6Anthropic152.383.329.91M$6.00
28GLM 5.1Z.ai (Zhipu AI)149.989.9—205K$2.15
29MiniMax M3MiniMax147.090.9—1.05M$0.53
30Kimi K2.7 CodeMoonshot AI150.087.930.5262K$1.32
31Muse Spark 1.2Meta155.2——1.05M$2.00
32Gemini 3.1 Pro PreviewGoogle—94.411.71.05M$4.50
33InklingThinking Machines Lab148.6——524K$1.76
34Gemini 3.5 FlashGoogle154.692.837.41.05M$3.38
35Qwen3.5 397B A17BAlibaba (Qwen)146.686.4—262K$1.29
36gpt-oss-120bOpenAI139.975.8—131K$0.070
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research