Skip to content

Best for reasoning

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
1GPT-6 AstraNEWOpenAI166.695.873.21.05M$20.00
2Gemini 3.8 FlashNEWGoogle157.195.473.81.05M$1.50
3Gemini 3.7 FlashGoogle157.794.865.31.05M$1.50
4GPT-5.4 ProxhighOpenAI—94.6———
5Gemini 3.1 Pro PreviewGoogle—94.411.71.05M$4.50
6Gemini 3.6 FlashGoogle154.494.146.71.05M$1.50
7Grok 4.6xAI · +1 variant156.594.065.2500K$3.00
8GPT-5.5xhighOpenAI · +2 variants—94.067.0——
9GPT-5.5 ProxhighOpenAI—93.9———
10Claude Opus 5Anthropic · +1 variant162.793.973.61M$10.00
11GPT-5.6 SolOpenAI · +2 variants162.093.572.71.05M$4.00
12Grok 4.5xAI154.093.453.8500K$3.00
13GPT-5.6 TerraOpenAI · +2 variants159.393.369.61.05M$4.50
14GPT-5.4xhighOpenAI · +4 variants—93.351.8——
15Kimi K3Moonshot AI · +1 variant157.793.168.51.05M$6.00
16Gemini 3.5 FlashGoogle154.692.837.41.05M$3.38
17Qwen3.8 MaxxhighAlibaba (Qwen)—92.757.5——
18Gemini 3 Pro PreviewGoogle—92.6———
19Qwen3.8 Max (0902)NEWxhighAlibaba (Qwen)—92.3———
20GLM 5.2Z.ai (Zhipu AI)151.891.943.81.05M$1.51
21DeepSeek V4 Pro 0813DeepSeek155.491.7—1.05M$1.41
22GPT-5.6 LunaOpenAI · +2 variants156.391.667.21.05M$0.45
23GPT-5.2xhighOpenAI · +4 variants—91.4———
24Claude Opus 4.8Anthropic158.391.059.01M$10.00
25DeepSeek V4 Flash 0731DeepSeek154.591.0—1.31M$0.093
26GLM 5.3Z.ai (Zhipu AI)155.690.969.01.31M$2.15
27Qwen3.7 MaxAlibaba (Qwen)153.790.9—1M$2.21
28MiniMax M3MiniMax147.090.9—1.05M$0.53
29DeepSeek v4 ProhighDeepSeek · +1 variant—90.9———
30Kimi K2.6Moonshot AI151.090.8—262K$1.34
31Claude Opus 4.632k thinkingAnthropic · +2 variants—90.5———
32Claude Sonnet 5xhighAnthropic · +1 variant—90.549.7——
33GLM 5.3 FlashZ.ai (Zhipu AI)151.990.263.41.31M$0.24
34Claude Opus 4.7xhighAnthropic · +1 variant—90.2———
35GLM 5.1Z.ai (Zhipu AI)149.989.9—205K$2.15
36Muse SparkMeta152.189.8———
37Gemini 3 Flash PreviewGoogle—89.4—1.05M$1.13
38Grok 4.20xAI152.089.3—2M$1.56
39Grok 4.3 BetaxAI149.188.8———
40Inkling SmallxhighThinking Machines Lab—88.5———
41Qwen 3.6 Plus (2026-04-02)Alibaba (Qwen)—88.4———
42InklingxhighThinking Machines Lab—88.3———
43Kimi K2.7 CodeMoonshot AI150.087.930.5262K$1.32
44Qwen3.7 PlusAlibaba (Qwen)147.487.9—1M$0.56
45GLM 5Z.ai (Zhipu AI)145.887.8—205K$0.93
46GPT-5.1OpenAI · +2 variants149.787.6—400K$3.44
47Kimi K2.5 (Fireworks)Moonshot AI—87.6———
48Qwen 3.6 Max (Preview)Alibaba (Qwen)149.387.4———
49Claude Sonnet 4.632k thinkingAnthropic · +2 variants—87.4———
50Grok 4xAI146.587.0———
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research