Best for reasoning
Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.
Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.
| # | Model | Capability | Reasoning | Coding | Context | $/M | Weights | Released |
|---|---|---|---|---|---|---|---|---|
| 51 | Llama 3.1-405BMeta | 128.8 | 50.9 | — | — | — | Open | 23 Jul 2024 |
| 52 | Qwen2.5-72BAlibaba (Qwen) | 129.0 | 49.1 | — | — | — | Open | 19 Sep 2024 |
| 53 | Mistral Small 3.2Mistral AI | 131.7 | 49.1 | — | — | — | Open | 20 Jun 2025 |
| 54 | Mistral Large 2 (Jul 2024)Mistral AI | 127.5 | 49.0 | — | — | — | Open | 24 Jul 2024 |
| 55 | Gemma 3 27BGoogle | 130.0 | 47.7 | — | 131K | $0.17 | Open | 12 Mar 2025 |
| 56 | Magistral Small 1.2Mistral AI | 131.4 | 47.6 | — | — | — | Open | 18 Sep 2025 |
| 57 | Mistral Small 3.1Mistral AI | 127.5 | 47.5 | — | — | — | Open | 17 Mar 2025 |
| 58 | Llama 3.3 70BMeta | 127.3 | 47.4 | — | — | — | Open | 6 Dec 2024 |
| 59 | Mistral Small 3Mistral AI | 127.1 | 47.3 | — | 33K | $0.058 | Open | 30 Jan 2025 |
| 60 | Tulu 3 (Tülu 3) 70BAllen Institute for AI | — | 46.3 | — | — | — | Open | 21 Nov 2024 |
| 61 | Qwen2.5-32BAlibaba (Qwen) | 128.5 | 46.1 | — | — | — | Open | 17 Sep 2024 |
| 62 | DeepSeek-R1-Distill-Qwen-14BDeepSeek | 135.4 | 44.7 | — | — | — | Open | 20 Jan 2025 |
| 63 | Llama 3.1-70BMeta | 125.9 | 44.2 | — | — | — | Open | 23 Jul 2024 |
| 64 | WizardLM-2 8x22BMicrosoft | — | 43.4 | — | 66K | $0.62 | Open | 16 Apr 2024 |
| 65 | Llama 3.2 90BMeta | 125.5 | 41.0 | — | — | — | Open | 24 Sep 2024 |
| 66 | Qwen2-72BAlibaba (Qwen) | 125.3 | 40.8 | — | — | — | Open | 7 Jun 2024 |
| 67 | Llama 3-70BMeta | 122.9 | 40.6 | — | — | — | Open | 18 Apr 2024 |
| 68 | Gemma 3 12BGoogle | 123.5 | 39.5 | — | 131K | $0.075 | Open | 12 Mar 2025 |
| 69 | Qwen3-1.7BAlibaba (Qwen) | — | 38.0 | — | — | — | Open | 29 Apr 2025 |
| 70 | Hermes 2 Theta Llama-3 70BNous Research | — | 37.5 | — | — | — | Open | 20 Jun 2024 |
| 71 | Gemma 2 27BGoogle | 122.1 | 36.5 | — | 8K | $0.65 | Open | 24 Jun 2024 |
| 72 | Qwen2.5-7BAlibaba (Qwen) | 118.4 | 35.5 | — | — | — | Open | 19 Sep 2024 |
| 73 | Mixtral 8x22BMistral AI | 122.0 | 34.1 | — | — | — | Open | 17 Apr 2024 |
| 74 | Eurus-2-7B-PRIMETsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute | — | 33.9 | — | — | — | Open | 31 Dec 2024 |
| 75 | DeepSeek-R1-Distill-Qwen-1.5BDeepSeek | — | 33.6 | — | — | — | Open | 20 Jan 2025 |
| 76 | DBRXDatabricks | — | 32.9 | — | — | — | Open | 27 Mar 2024 |
| 77 | Yi-1.5-34B01.AI | — | 32.0 | — | — | — | Open | 13 May 2024 |
| 78 | Qwen1.5-32BAlibaba (Qwen) | — | 30.7 | — | — | — | Open | 3 Apr 2024 |
| 79 | Mixtral 8x7BMistral AI | 118.4 | 30.6 | — | — | — | Open | 11 Dec 2023 |
| 80 | Mistral NemoMistral AI | 118.6 | 29.9 | — | 131K | $0.022 | Open | 18 Jul 2024 |
| 81 | Qwen1.5-72BAlibaba (Qwen) | — | 28.8 | — | — | — | Open | 4 Feb 2024 |
| 82 | Granite 4.0 MicroIBM | — | 28.3 | — | 131K | $0.041 | Open | 20 Oct 2025 |
| 83 | phi-3-medium 14BMicrosoft | 121.2 | 27.6 | — | — | — | Open | 23 Apr 2024 |
| 84 | Gemma 2 9BGoogle | 119.8 | 27.5 | — | — | — | Open | 24 Jun 2024 |
| 85 | Ministral 8BMistral AI | — | 27.1 | — | — | — | Open | 16 Oct 2024 |
| 86 | Llama 3.1-8BMeta | 116.5 | 27.0 | — | — | — | Open | 23 Jul 2024 |
| 87 | Llama 2-70BMeta | 113.6 | 26.3 | — | — | — | Open | 18 Jul 2023 |
| 88 | Llama 3-8BMeta | 116.3 | 26.1 | — | — | — | Open | 18 Apr 2024 |
| 89 | DeepSeek LLM 67BDeepSeek | 110.5 | 24.6 | — | — | — | Open | 29 Nov 2023 |
| 90 | Llama 3.2 1BMeta | 102.0 | 23.9 | — | — | — | Open | 24 Sep 2024 |
| 91 | Gemma 3 4BGoogle | 116.0 | 23.2 | — | 131K | $0.063 | Open | 12 Mar 2025 |
| 92 | Gemma 3 1BGoogle | — | 19.9 | — | — | — | Open | 12 Mar 2025 |
| 93 | Mistral 7B v0.3Mistral AI | 108.7 | 15.2 | — | — | — | Open | 27 May 2024 |
| 94 | Yi-34B01.AI | 117.3 | 14.7 | — | — | — | Open | 2 Nov 2023 |
— means no published score from that source yet · click a model for every benchmark with its source
New - awaiting independent evaluation
All new models →- Claude Sonnet 5.5Anthropic · 28 Sep 2026 · AA 56 · 1M · $4.00/M
- Qwen3.8 Max PrimeAlibaba (Qwen) · 23 Sep 2026 · 1M · $6.00/M
- GPT-6 SolOpenAI · 22 Sep 2026 · AA 47.5 · 1.05M · $4.00/M
- GPT-6 LunaOpenAI · 22 Sep 2026 · AA 37.3 · 1.05M · $0.20/M
- GPT-6 Sol ProOpenAI · 22 Sep 2026 · 1.05M · $4.00/M
- GPT-6 Luna ProOpenAI · 22 Sep 2026 · 1.05M · $0.20/M
- Claude Opus 5.5Anthropic · 22 Sep 2026 · AA 57.6 · 1M · $8.00/M
- Grok 4.7xAI · 21 Sep 2026 · AA 46.4 · 500K · $3.00/M
Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.
Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research