Best for math
Ranked by Epoch's mock AIME 2024-2025 (competition mathematics).
Ranked by Epoch's mock AIME 2024-2025 (competition mathematics). Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.
| # | Model | Capability | Reasoning | Coding | Context | $/M | Weights | Released |
|---|---|---|---|---|---|---|---|---|
| 51 | InklingxhighThinking Machines Lab | — | 88.3 | — | — | — | Open | 15 Jul 2026 |
| 52 | GPT-5.1OpenAI · +3 variants | 149.7 | 87.6 | — | 400K | $3.44 | Closed | 13 Nov 2025 |
| 53 | DeepSeek V3.2DeepSeek | 146.3 | 83.4 | — | 164K | $0.32 | Open | 1 Dec 2025 |
| 54 | GPT-5.4 NanoOpenAI · +2 variants | 145.8 | 78.5 | — | 400K | $0.46 | Closed | 17 Mar 2026 |
| 55 | Nemotron 3 UltraNVIDIA | 146.2 | 85.4 | — | 262K | $1.05 | Open | 4 Jun 2026 |
| 56 | GPT-5 MiniOpenAI · +2 variants | 145.5 | 75.0 | — | 400K | $0.69 | Closed | 7 Aug 2025 |
| 57 | Qwen3.7 FlashAlibaba (Qwen) | 144.6 | 82.3 | — | 1M | $0.055 | Closed | 27 Jul 2026 |
| 58 | Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen) | 143.9 | 80.1 | — | — | — | Open | 25 Jul 2025 |
| 59 | Qwen3.5 Plus 2026-02-15Alibaba (Qwen) | — | 84.8 | — | 1M | $0.58 | — | 16 Feb 2026 |
| 60 | Qwen3.6 35B A3BAlibaba (Qwen) | — | 84.8 | — | 262K | $0.36 | Open | 27 Apr 2026 |
| 61 | GLM 5.2Z.ai (Zhipu AI) | 151.8 | 91.9 | 43.8 | 1.05M | $1.39 | Open | 16 Jun 2026 |
| 62 | Claude Opus 4.532k thinkingAnthropic · +2 variants | — | 86.0 | — | — | — | Closed | 24 Nov 2025 |
| 63 | Claude Sonnet 4.632k thinkingAnthropic · +2 variants | — | 87.4 | — | — | — | Closed | 17 Feb 2026 |
| 64 | Gemini 2.5 Pro (Jun 2025)Google | 145.3 | 85.3 | — | — | — | Closed | 5 Jun 2025 |
| 65 | o3mediumOpenAI · +2 variants | — | 80.8 | — | — | — | Closed | 16 Apr 2025 |
| 66 | Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen) | — | 83.3 | — | — | — | — | 27 Apr 2026 |
| 67 | Qwen3.5-FlashAlibaba (Qwen) | — | 82.3 | — | 1M | $0.11 | — | 25 Feb 2026 |
| 68 | Grok 4xAI | 146.5 | 87.0 | — | — | — | Closed | 9 Jul 2025 |
| 69 | GLM 4.7Z.ai (Zhipu AI) | 143.5 | 83.3 | — | 205K | $1.00 | Open | 22 Dec 2025 |
| 70 | Kimi K2 Thinking TurboMoonshot AI | — | 84.2 | — | — | — | Open | 6 Nov 2025 |
| 71 | Gemma 4 26B A4BGoogle | 141.8 | 73.2 | — | 262K | $0.14 | Open | 2 Apr 2026 |
| 72 | o4 MiniOpenAI | 145.6 | 79.6 | — | 200K | $1.93 | Closed | 16 Apr 2025 |
| 73 | GPT-5 NanoOpenAI · +3 variants | 139.4 | 69.4 | — | 400K | $0.14 | Closed | 7 Aug 2025 |
| 74 | GLM 5Z.ai (Zhipu AI) | 145.8 | 87.8 | — | 205K | $0.93 | Open | 11 Feb 2026 |
| 75 | Gemini 3.1 Flash LiteGoogle | 144.4 | 81.8 | — | 1.05M | $0.56 | Closed | 3 Mar 2026 |
| 76 | Grok-3 minixAI | 140.3 | 76.3 | — | — | — | Closed | 24 Jun 2025 |
| 77 | Claude Sonnet 4.559k thinkingAnthropic · +3 variants | — | 82.3 | — | — | — | Closed | 29 Sep 2025 |
| 78 | o3 MiniOpenAI | 140.3 | 77.0 | — | 200K | $1.93 | Closed | 31 Jan 2025 |
| 79 | Gemma 4 31BGoogle | 142.7 | 75.8 | — | 262K | $0.15 | Open | 2 Apr 2026 |
| 80 | o1OpenAI · +2 variants | 141.9 | 76.8 | — | 200K | $26.25 | Closed | 17 Dec 2024 |
| 81 | o4-minimediumOpenAI · +1 variant | — | 77.8 | — | — | — | Closed | 16 Apr 2025 |
| 82 | Qwen3-Max-InstructAlibaba (Qwen) | — | 72.6 | — | — | — | Closed | 24 Sep 2025 |
| 83 | Gemini 2.5 Flash Preview (Apr 2025)Google | — | — | — | — | — | Closed | 17 Apr 2025 |
| 84 | MiniMax M3MiniMax | 147.0 | 90.9 | — | 1.05M | $0.53 | Open | 1 Jun 2026 |
| 85 | Gemini 3.5 Flash LiteGoogle | 145.1 | 83.3 | — | 1.05M | $0.85 | Closed | 21 Jul 2026 |
| 86 | Claude Sonnet 4Anthropic | 141.7 | 79.2 | — | 200K | $6.00 | Closed | 22 May 2025 |
| 87 | Gemini 2.5 Flash (May 2025)Google | 141.5 | — | — | — | — | Closed | 20 May 2025 |
| 88 | Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba (Qwen) | 139.6 | 70.1 | — | — | — | Open | 30 Jul 2025 |
| 89 | Qwen3.5-35B-A3BAlibaba (Qwen) | 142.5 | 83.5 | — | 262K | $0.45 | Open | 24 Feb 2026 |
| 90 | Claude Opus 4.1Anthropic | 144.1 | 77.3 | — | 200K | $30.00 | Closed | 5 Aug 2025 |
| 91 | GPT-5.5 InstantOpenAI | 142.5 | 82.5 | — | — | — | Closed | 5 May 2026 |
| 92 | seed-oss-36b-instruct | — | 71.5 | — | — | — | — | 20 Aug 2025 |
| 93 | Qwen3 32BAlibaba (Qwen) | 138.5 | 65.7 | — | 131K | $0.13 | Open | 29 Apr 2025 |
| 94 | Claude Haiku 4.5Anthropic | 142.4 | 71.2 | — | 200K | $2.00 | Closed | 15 Oct 2025 |
| 95 | DeepSeek-R1 (May 2025)DeepSeek | 141.3 | 76.3 | — | — | — | Open | 28 May 2025 |
| 96 | Qwen3 14BAlibaba (Qwen) | 138.2 | 63.8 | — | 131K | $0.15 | Open | 29 Apr 2025 |
| 97 | gpt-oss-20bOpenAI | 137.8 | 60.8 | — | 131K | $0.036 | Open | 5 Aug 2025 |
| 98 | Claude Opus 4Anthropic | 142.7 | 76.3 | — | — | — | Closed | 22 May 2025 |
| 99 | o3-minimediumOpenAI | — | 74.3 | — | — | — | Closed | 31 Jan 2025 |
| 100 | Qwen3 30B A3BAlibaba (Qwen) | 136.2 | 61.7 | — | 131K | $0.23 | Open | 29 Apr 2025 |
— means no published score from that source yet · click a model for every benchmark with its source
New - awaiting independent evaluation
All new models →- Claude Sonnet 5.5Anthropic · 28 Sep 2026 · AA 56 · 1M · $4.00/M
- Qwen3.8 Max PrimeAlibaba (Qwen) · 23 Sep 2026 · 1M · $6.00/M
- GPT-6 SolOpenAI · 22 Sep 2026 · AA 47.5 · 1.05M · $4.00/M
- GPT-6 LunaOpenAI · 22 Sep 2026 · AA 37.3 · 1.05M · $0.20/M
- GPT-6 Sol ProOpenAI · 22 Sep 2026 · 1.05M · $4.00/M
- GPT-6 Luna ProOpenAI · 22 Sep 2026 · 1.05M · $0.20/M
- Claude Opus 5.5Anthropic · 22 Sep 2026 · AA 57.6 · 1M · $8.00/M
- Grok 4.7xAI · 21 Sep 2026 · AA 46.4 · 500K · $3.00/M
Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.
Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research