Skip to content

Best for math

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics).

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics). Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
51InklingxhighThinking Machines Lab—88.3———
52GPT-5.1OpenAI · +3 variants149.787.6—400K$3.44
53DeepSeek V3.2DeepSeek146.383.4—164K$0.32
54GPT-5.4 NanoOpenAI · +2 variants145.878.5—400K$0.46
55Nemotron 3 UltraNVIDIA146.285.4—262K$1.05
56GPT-5 MiniOpenAI · +2 variants145.575.0—400K$0.69
57Qwen3.7 FlashAlibaba (Qwen)144.682.3—1M$0.055
58Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen)143.980.1———
59Qwen3.5 Plus 2026-02-15Alibaba (Qwen)—84.8—1M$0.58
60Qwen3.6 35B A3BAlibaba (Qwen)—84.8—262K$0.36
61GLM 5.2Z.ai (Zhipu AI)151.891.943.81.05M$1.39
62Claude Opus 4.532k thinkingAnthropic · +2 variants—86.0———
63Claude Sonnet 4.632k thinkingAnthropic · +2 variants—87.4———
64Gemini 2.5 Pro (Jun 2025)Google145.385.3———
65o3mediumOpenAI · +2 variants—80.8———
66Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen)—83.3———
67Qwen3.5-FlashAlibaba (Qwen)—82.3—1M$0.11
68Grok 4xAI146.587.0———
69GLM 4.7Z.ai (Zhipu AI)143.583.3—205K$1.00
70Kimi K2 Thinking TurboMoonshot AI—84.2———
71Gemma 4 26B A4BGoogle141.873.2—262K$0.14
72o4 MiniOpenAI145.679.6—200K$1.93
73GPT-5 NanoOpenAI · +3 variants139.469.4—400K$0.14
74GLM 5Z.ai (Zhipu AI)145.887.8—205K$0.93
75Gemini 3.1 Flash LiteGoogle144.481.8—1.05M$0.56
76Grok-3 minixAI140.376.3———
77Claude Sonnet 4.559k thinkingAnthropic · +3 variants—82.3———
78o3 MiniOpenAI140.377.0—200K$1.93
79Gemma 4 31BGoogle142.775.8—262K$0.15
80o1OpenAI · +2 variants141.976.8—200K$26.25
81o4-minimediumOpenAI · +1 variant—77.8———
82Qwen3-Max-InstructAlibaba (Qwen)—72.6———
83Gemini 2.5 Flash Preview (Apr 2025)Google—————
84MiniMax M3MiniMax147.090.9—1.05M$0.53
85Gemini 3.5 Flash LiteGoogle145.183.3—1.05M$0.85
86Claude Sonnet 4Anthropic141.779.2—200K$6.00
87Gemini 2.5 Flash (May 2025)Google141.5————
88Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba (Qwen)139.670.1———
89Qwen3.5-35B-A3BAlibaba (Qwen)142.583.5—262K$0.45
90Claude Opus 4.1Anthropic144.177.3—200K$30.00
91GPT-5.5 InstantOpenAI142.582.5———
92seed-oss-36b-instruct—71.5———
93Qwen3 32BAlibaba (Qwen)138.565.7—131K$0.13
94Claude Haiku 4.5Anthropic142.471.2—200K$2.00
95DeepSeek-R1 (May 2025)DeepSeek141.376.3———
96Qwen3 14BAlibaba (Qwen)138.263.8—131K$0.15
97gpt-oss-20bOpenAI137.860.8—131K$0.036
98Claude Opus 4Anthropic142.776.3———
99o3-minimediumOpenAI—74.3———
100Qwen3 30B A3BAlibaba (Qwen)136.261.7—131K$0.23
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research