Skip to content

Best for reasoning

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
51GPT-5.4 minixhighOpenAI · +2 variants—86.9———
52Qwen3.5 397B A17BAlibaba (Qwen)146.686.4—262K$1.29
53GPT-5OpenAI · +2 variants150.086.2—400K$3.44
54Claude Opus 4.532k thinkingAnthropic · +2 variants—86.0———
55Claude Fable 5Anthropic · +1 variant163.685.969.71M$20.00
56Qwen3.6 27BAlibaba (Qwen)146.585.9—262K$1.04
57Nemotron 3 UltraNVIDIA146.285.4—262K$1.05
58Gemini 2.5 Pro (Jun 2025)Google145.385.3———
59Gemini 2.5 Pro Preview (Jun 2025)Google—84.8———
60Qwen3.5 Plus 2026-02-15Alibaba (Qwen)—84.8—1M$0.58
61Qwen3.6 35B A3BAlibaba (Qwen)—84.8—262K$0.36
62Kimi K2 Thinking TurboMoonshot AI—84.2———
63Gemini 2.5 Pro Exp (Mar 2025)Google—83.8———
64Qwen3.5-35B-A3BAlibaba (Qwen)142.583.5—262K$0.45
65DeepSeek V3.2DeepSeek146.383.4—164K$0.32
66Gemini 3.5 Flash LiteGoogle145.183.3—1.05M$0.85
67GLM 4.7Z.ai (Zhipu AI)143.583.3—205K$1.00
68Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen)—83.3———
69GPT-5.5 InstantOpenAI142.582.5———
70Qwen3.7 FlashAlibaba (Qwen)144.682.3—1M$0.055
71Claude Sonnet 4.559k thinkingAnthropic · +3 variants—82.3———
72Qwen3.5-FlashAlibaba (Qwen)—82.3—1M$0.11
73o3OpenAI · +2 variants146.981.8—200K$3.50
74Gemini 3.1 Flash LiteGoogle144.481.8—1.05M$0.56
75Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen)143.980.1———
76Claude 3.7 Sonnet64k thinkingAnthropic · +3 variants—79.7———
77o4 MiniOpenAI145.679.6—200K$1.93
78Claude Sonnet 4Anthropic141.779.2—200K$6.00
79Qwen3.5-9BAlibaba (Qwen)139.479.0—262K$0.11
80GPT-5.4 NanoOpenAI · +2 variants145.878.5—400K$0.46
81o4-minimediumOpenAI · +1 variant—77.8———
82Claude Opus 4.1Anthropic144.177.3—200K$30.00
83o3 MiniOpenAI140.377.0—200K$1.93
84o1OpenAI · +2 variants141.976.8—200K$26.25
85DeepSeek-R1 (May 2025)DeepSeek141.376.3———
86Claude Opus 4Anthropic142.776.3———
87Grok-3 minixAI140.376.3———
88Gemma 4 31BGoogle142.775.8—262K$0.15
89gpt-oss-120bOpenAI139.975.8—131K$0.070
90Grok 3xAI138.375.8———
91GPT-5 MiniOpenAI · +2 variants145.575.0—400K$0.69
92o3-minimediumOpenAI—74.3———
93Gemma 4 26B A4BGoogle141.873.2—262K$0.14
94Qwen3-Max-InstructAlibaba (Qwen)—72.6———
95R1DeepSeek139.071.7—64K$1.15
96seed-oss-36b-instruct—71.5———
97Claude Haiku 4.5Anthropic142.471.2—200K$2.00
98Qwen3 235B A22BAlibaba (Qwen)139.470.7—131K$0.80
99Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba (Qwen)139.670.1———
100GPT-5 NanoOpenAI · +3 variants139.469.4—400K$0.14
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research