Best for reasoning
Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.
Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.
| # | Model | Capability | Reasoning | Coding | Context | $/M | Weights | Released |
|---|---|---|---|---|---|---|---|---|
| 51 | GPT-5.4 minixhighOpenAI · +2 variants | — | 86.9 | — | — | — | Closed | 17 Mar 2026 |
| 52 | Qwen3.5 397B A17BAlibaba (Qwen) | 146.6 | 86.4 | — | 262K | $1.29 | Open | 13 Feb 2026 |
| 53 | GPT-5OpenAI · +2 variants | 150.0 | 86.2 | — | 400K | $3.44 | Closed | 7 Aug 2025 |
| 54 | Claude Opus 4.532k thinkingAnthropic · +2 variants | — | 86.0 | — | — | — | Closed | 24 Nov 2025 |
| 55 | Claude Fable 5Anthropic · +1 variant | 163.6 | 85.9 | 69.7 | 1M | $20.00 | Closed | 9 Jun 2026 |
| 56 | Qwen3.6 27BAlibaba (Qwen) | 146.5 | 85.9 | — | 262K | $1.04 | Open | 22 Apr 2026 |
| 57 | Nemotron 3 UltraNVIDIA | 146.2 | 85.4 | — | 262K | $1.05 | Open | 4 Jun 2026 |
| 58 | Gemini 2.5 Pro (Jun 2025)Google | 145.3 | 85.3 | — | — | — | Closed | 5 Jun 2025 |
| 59 | Gemini 2.5 Pro Preview (Jun 2025)Google | — | 84.8 | — | — | — | Closed | 5 Jun 2025 |
| 60 | Qwen3.5 Plus 2026-02-15Alibaba (Qwen) | — | 84.8 | — | 1M | $0.58 | — | 16 Feb 2026 |
| 61 | Qwen3.6 35B A3BAlibaba (Qwen) | — | 84.8 | — | 262K | $0.36 | Open | 27 Apr 2026 |
| 62 | Kimi K2 Thinking TurboMoonshot AI | — | 84.2 | — | — | — | Open | 6 Nov 2025 |
| 63 | Gemini 2.5 Pro Exp (Mar 2025)Google | — | 83.8 | — | — | — | Closed | 25 Mar 2025 |
| 64 | Qwen3.5-35B-A3BAlibaba (Qwen) | 142.5 | 83.5 | — | 262K | $0.45 | Open | 24 Feb 2026 |
| 65 | DeepSeek V3.2DeepSeek | 146.3 | 83.4 | — | 164K | $0.32 | Open | 1 Dec 2025 |
| 66 | Gemini 3.5 Flash LiteGoogle | 145.1 | 83.3 | — | 1.05M | $0.85 | Closed | 21 Jul 2026 |
| 67 | GLM 4.7Z.ai (Zhipu AI) | 143.5 | 83.3 | — | 205K | $1.00 | Open | 22 Dec 2025 |
| 68 | Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen) | — | 83.3 | — | — | — | — | 27 Apr 2026 |
| 69 | GPT-5.5 InstantOpenAI | 142.5 | 82.5 | — | — | — | Closed | 5 May 2026 |
| 70 | Qwen3.7 FlashAlibaba (Qwen) | 144.6 | 82.3 | — | 1M | $0.055 | Closed | 27 Jul 2026 |
| 71 | Claude Sonnet 4.559k thinkingAnthropic · +3 variants | — | 82.3 | — | — | — | Closed | 29 Sep 2025 |
| 72 | Qwen3.5-FlashAlibaba (Qwen) | — | 82.3 | — | 1M | $0.11 | — | 25 Feb 2026 |
| 73 | o3OpenAI · +2 variants | 146.9 | 81.8 | — | 200K | $3.50 | Closed | 16 Apr 2025 |
| 74 | Gemini 3.1 Flash LiteGoogle | 144.4 | 81.8 | — | 1.05M | $0.56 | Closed | 3 Mar 2026 |
| 75 | Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen) | 143.9 | 80.1 | — | — | — | Open | 25 Jul 2025 |
| 76 | Claude 3.7 Sonnet64k thinkingAnthropic · +3 variants | — | 79.7 | — | — | — | Closed | 24 Feb 2025 |
| 77 | o4 MiniOpenAI | 145.6 | 79.6 | — | 200K | $1.93 | Closed | 16 Apr 2025 |
| 78 | Claude Sonnet 4Anthropic | 141.7 | 79.2 | — | 200K | $6.00 | Closed | 22 May 2025 |
| 79 | Qwen3.5-9BAlibaba (Qwen) | 139.4 | 79.0 | — | 262K | $0.11 | Open | 24 Feb 2026 |
| 80 | GPT-5.4 NanoOpenAI · +2 variants | 145.8 | 78.5 | — | 400K | $0.46 | Closed | 17 Mar 2026 |
| 81 | o4-minimediumOpenAI · +1 variant | — | 77.8 | — | — | — | Closed | 16 Apr 2025 |
| 82 | Claude Opus 4.1Anthropic | 144.1 | 77.3 | — | 200K | $30.00 | Closed | 5 Aug 2025 |
| 83 | o3 MiniOpenAI | 140.3 | 77.0 | — | 200K | $1.93 | Closed | 31 Jan 2025 |
| 84 | o1OpenAI · +2 variants | 141.9 | 76.8 | — | 200K | $26.25 | Closed | 17 Dec 2024 |
| 85 | DeepSeek-R1 (May 2025)DeepSeek | 141.3 | 76.3 | — | — | — | Open | 28 May 2025 |
| 86 | Claude Opus 4Anthropic | 142.7 | 76.3 | — | — | — | Closed | 22 May 2025 |
| 87 | Grok-3 minixAI | 140.3 | 76.3 | — | — | — | Closed | 24 Jun 2025 |
| 88 | Gemma 4 31BGoogle | 142.7 | 75.8 | — | 262K | $0.15 | Open | 2 Apr 2026 |
| 89 | gpt-oss-120bOpenAI | 139.9 | 75.8 | — | 131K | $0.070 | Open | 5 Aug 2025 |
| 90 | Grok 3xAI | 138.3 | 75.8 | — | — | — | Closed | 9 Apr 2025 |
| 91 | GPT-5 MiniOpenAI · +2 variants | 145.5 | 75.0 | — | 400K | $0.69 | Closed | 7 Aug 2025 |
| 92 | o3-minimediumOpenAI | — | 74.3 | — | — | — | Closed | 31 Jan 2025 |
| 93 | Gemma 4 26B A4BGoogle | 141.8 | 73.2 | — | 262K | $0.14 | Open | 2 Apr 2026 |
| 94 | Qwen3-Max-InstructAlibaba (Qwen) | — | 72.6 | — | — | — | Closed | 24 Sep 2025 |
| 95 | R1DeepSeek | 139.0 | 71.7 | — | 64K | $1.15 | Open | 20 Jan 2025 |
| 96 | seed-oss-36b-instruct | — | 71.5 | — | — | — | — | 20 Aug 2025 |
| 97 | Claude Haiku 4.5Anthropic | 142.4 | 71.2 | — | 200K | $2.00 | Closed | 15 Oct 2025 |
| 98 | Qwen3 235B A22BAlibaba (Qwen) | 139.4 | 70.7 | — | 131K | $0.80 | Open | 28 Apr 2025 |
| 99 | Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba (Qwen) | 139.6 | 70.1 | — | — | — | Open | 30 Jul 2025 |
| 100 | GPT-5 NanoOpenAI · +3 variants | 139.4 | 69.4 | — | 400K | $0.14 | Closed | 7 Aug 2025 |
— means no published score from that source yet · click a model for every benchmark with its source
New - awaiting independent evaluation
All new models →- Claude Sonnet 5.5Anthropic · 28 Sep 2026 · AA 56 · 1M · $4.00/M
- Qwen3.8 Max PrimeAlibaba (Qwen) · 23 Sep 2026 · 1M · $6.00/M
- GPT-6 SolOpenAI · 22 Sep 2026 · AA 47.5 · 1.05M · $4.00/M
- GPT-6 LunaOpenAI · 22 Sep 2026 · AA 37.3 · 1.05M · $0.20/M
- GPT-6 Sol ProOpenAI · 22 Sep 2026 · 1.05M · $4.00/M
- GPT-6 Luna ProOpenAI · 22 Sep 2026 · 1.05M · $0.20/M
- Claude Opus 5.5Anthropic · 22 Sep 2026 · AA 57.6 · 1M · $8.00/M
- Grok 4.7xAI · 21 Sep 2026 · AA 46.4 · 500K · $3.00/M
Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.
Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research