Skip to content
math benchmark · included in ECI

MATH level 5

The hardest subset of the MATH competition dataset.
Results
41
Random baseline
0.0%
Score ceiling
100%
Released
5 Mar 2021

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek-R1 (May 2025) Open source
DeepSeek
96.6% ±0.4Source ↗
2R1 Open source
DeepSeek
93.1% ±0.7Source ↗
3DeepSeek-R1-Distill-Llama-70B Open source
DeepSeek
89.9% ±0.7Source ↗
4DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
87.1% ±0.7Source ↗
5DeepSeek-V3 (Mar 2025) Open source
DeepSeek
75.5% ±0.9Source ↗
6Gemma 3 27B Open source
Google
74.0% ±1.1Source ↗
7Llama 4 Maverick (FP8) Open source
Meta AI
73.0% ±1.1Source ↗
8Qwen3 235B A22B Open source
Qwen
68.9% ±0.9Source ↗
9Phi 4 Open source
Microsoft
64.9% ±1.1Source ↗
10DeepSeek V3 Open source
DeepSeek
64.9% ±1.0Source ↗
11Qwen2.5-72B Open source
Alibaba
63.2% ±1.1Source ↗
12Llama 4 Scout Open source
Meta
62.3% ±1.2Source ↗
13Qwen2.5-32B Open source
Alibaba
56.1% ±1.1Source ↗
14Mistral Large 2 (Nov 2024) Open source
Mistral AI
50.3% ±1.1Source ↗
15Llama 3.1-405B Open source
Meta AI
49.8% ±1.2Source ↗
16Mistral Small 3.1 Open source
Mistral AI
46.8% ±1.2Source ↗
17Mistral Small 3 Open source
Mistral
44.8% ±1.1Source ↗
18Mistral Large 2 (Jul 2024) Open source
Mistral AI
44.8% ±1.1Source ↗
19Tulu 3 (Tülu 3) 70B Open source
Allen Institute for AI,University of Washington
42.7% ±1.0Source ↗
20Llama 3.3 70B Open source
Meta AI
41.6% ±1.2Source ↗
21Llama 3.2 90B Open source
Meta AI
39.4% ±1.0Source ↗
22Qwen2-72B Open source
Alibaba
39.1% ±1.0Source ↗
23Llama 3.1-70B Open source
Meta AI
36.7% ±1.0Source ↗
24Gemma 2 27B Open source
Google
27.9% ±1.0Source ↗
25WizardLM-2 8x22B Open source
microsoft
25.7% ±0.9Source ↗
26Yi-1.5-34B Open source
01.AI
25.5% ±0.9Source ↗
27Mixtral 8x22B Open source
Mistral AI
24.2% ±0.8Source ↗
28Llama 3.1-8B Open source
Meta AI
22.9% ±0.9Source ↗
29Hermes 2 Theta Llama-3 70B Open source
Nous Research,Arcee AI
22.7% ±0.8Source ↗
30Llama 3-70B Open source
Meta AI
22.6% ±0.8Source ↗
31Gemma 2 9B Open source
Google DeepMind
21.0% ±0.9Source ↗
32phi-3-medium 14B Open source
Microsoft
17.6% ±0.7Source ↗
33Ministral 8B Open source
Mistral AI
14.9% ±0.7Source ↗
34DBRX Open source
Databricks
11.7% ±0.7Source ↗
35Mistral Nemo Open source
Mistral
10.8% ±0.6Source ↗
36Mixtral 8x7B Open source
Mistral AI
10.0% ±0.5Source ↗
37DeepSeek LLM 67B Open source
DeepSeek
6.4% ±0.4Source ↗
38Llama 3-8B Open source
Meta AI
6.1% ±0.4Source ↗
39Yi-34B Open source
01.AI
5.1% ±0.3Source ↗
40Mistral 7B v0.3 Open source
Mistral AI
3.7% ±0.3Source ↗
41Llama 2-70B Open source
Meta AI
3.3% ±0.3Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.