Skip to content
math benchmark · included in ECI

MATH level 5

The hardest subset of the MATH competition dataset.
Results
104
Random baseline
0.0%
Score ceiling
100%
Released
5 Mar 2021

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-5
OpenAI
98.1% ±0.3Source ↗
2GPT-5 (medium)
OpenAI
97.9% ±0.3Source ↗
3GPT-5 Mini
OpenAI
97.8% ±0.3Source ↗
4o4 Mini
OpenAI
97.8% ±0.3Source ↗
5o3
OpenAI
97.8% ±0.3Source ↗
6Claude Sonnet 4.5 (32k thinking)
Anthropic
97.7% ±0.4Source ↗
7Qwen3-Max-Instruct
Alibaba
97.1% ±0.4Source ↗
8GPT-5 mini (medium)
OpenAI
96.8% ±0.4Source ↗
9DeepSeek-R1 (May 2025) Open source
DeepSeek
96.6% ±0.4Source ↗
10o3 Mini
OpenAI
96.5% ±0.4Source ↗
11Claude Haiku 4.5
Anthropic
96.4% ±0.5Source ↗
12Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
95.9% ±0.4Source ↗
13Gemini 2.5 Pro Preview (Mar 2025)
Google DeepMind
95.6% ±0.4Source ↗
14GPT-5 nano (medium)
OpenAI
95.2% ±0.5Source ↗
15o3-mini (medium)
OpenAI
95.2% ±0.5Source ↗
16GPT-5 Nano
OpenAI
94.9% ±0.5Source ↗
17o1
OpenAI
94.7% ±0.6Source ↗
18o1 (medium)
OpenAI
94.4% ±0.6Source ↗
19R1 Open source
DeepSeek
93.1% ±0.7Source ↗
20Claude 3.7 Sonnet (64k thinking)
Anthropic
91.2% ±0.8Source ↗
21Grok-3 mini
xAI
90.9% ±0.8Source ↗
22Claude 3.7 Sonnet (32k thinking)
Anthropic
90.0% ±0.8Source ↗
23DeepSeek-R1-Distill-Llama-70B Open source
DeepSeek
89.9% ±0.7Source ↗
24o1-mini
OpenAI
89.2% ±0.7Source ↗
25Grok 3
xAI
88.7% ±0.9Source ↗
26GPT-4.1 Mini
OpenAI
87.3% ±0.7Source ↗
27DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
87.1% ±0.7Source ↗
28Claude 3.7 Sonnet (16k thinking)
Anthropic
86.3% ±0.9Source ↗
29Claude Opus 4
Anthropic
85.0% ±1.0Source ↗
30Claude Sonnet 4
Anthropic
84.4% ±1.0Source ↗
31o1-mini (medium)
OpenAI
84.3% ±0.8Source ↗
32Gemini 2.0 Pro Exp (Feb 2025)
Google DeepMind
83.5% ±1.0Source ↗
33GPT-4.1
OpenAI
83.0% ±0.8Source ↗
34Gemini 2.0 Flash (Feb 2025)
Google DeepMind,Google
82.2% ±0.9Source ↗
35o1-preview
OpenAI
81.6% ±1.1Source ↗
36Mistral Medium 3
Mistral
81.6% ±0.9Source ↗
37GPT-4.5 Preview (Feb 2025)
OpenAI
78.6% ±1.1Source ↗
38DeepSeek-V3 (Mar 2025) Open source
DeepSeek
75.5% ±0.9Source ↗
39Gemma 3 27B Open source
Google
74.0% ±1.1Source ↗
40Llama 4 Maverick (FP8) Open source
Meta AI
73.0% ±1.1Source ↗
41Gemini 1.5 Pro (Sept 2024)
Google DeepMind
70.4% ±1.0Source ↗
42GPT-4.1 Nano
OpenAI
70.0% ±1.0Source ↗
43Qwen3 235B A22B Open source
Qwen
68.9% ±0.9Source ↗
44Claude 3.7 Sonnet
Anthropic
68.2% ±1.1Source ↗
45Qwen2.5-Max
Alibaba
67.2% ±1.1Source ↗
46Qwen Plus (Jan 2025)
Alibaba
65.3% ±1.1Source ↗
47Phi 4 Open source
Microsoft
64.9% ±1.1Source ↗
48DeepSeek V3 Open source
DeepSeek
64.9% ±1.0Source ↗
49Grok-2 (Dec 2024)
xAI
63.5% ±1.3Source ↗
50Qwen2.5-72B Open source
Alibaba
63.2% ±1.1Source ↗
51Llama 4 Scout Open source
Meta
62.3% ±1.2Source ↗
52Gemini 1.5 Flash (Sep 2024)
Google DeepMind
61.9% ±1.1Source ↗
53Claude 3.5 Sonnet (Oct 2024)
Anthropic
56.9% ±1.1Source ↗
54Qwen-Turbo
Alibaba
56.2% ±1.1Source ↗
55Qwen2.5-32B Open source
Alibaba
56.1% ±1.1Source ↗
56GPT-4o (Aug 2024)
OpenAI
53.3% ±1.1Source ↗
57GPT-4o-mini
OpenAI
52.6% ±1.1Source ↗
58Claude 3.5 Sonnet (Jun 2024)
Anthropic
51.7% ±1.2Source ↗
59GPT-4o (May 2024)
OpenAI
51.0% ±1.1Source ↗
60Mistral Large 2 (Nov 2024) Open source
Mistral AI
50.3% ±1.1Source ↗
61GPT-4o (Nov 2024)
OpenAI
49.8% ±1.1Source ↗
62Llama 3.1-405B Open source
Meta AI
49.8% ±1.2Source ↗
63Mistral Small 3.1 Open source
Mistral AI
46.8% ±1.2Source ↗
64GPT-4 Turbo (Apr 2024)
OpenAI
46.7% ±1.1Source ↗
65Claude 3.5 Haiku (Oct 2024)
Anthropic
46.4% ±1.2Source ↗
66Mistral Small 3 Open source
Mistral
44.8% ±1.1Source ↗
67Mistral Large 2 (Jul 2024) Open source
Mistral AI
44.8% ±1.1Source ↗
68Tulu 3 (Tülu 3) 70B Open source
Allen Institute for AI,University of Washington
42.7% ±1.0Source ↗
69Llama 3.3 70B Open source
Meta AI
41.6% ±1.2Source ↗
70Gemini 1.5 Pro (May 2024)
Google DeepMind
40.7% ±1.1Source ↗
71GPT-4 Turbo Preview (Nov 2023)
OpenAI
40.0% ±1.1Source ↗
72Llama 3.2 90B Open source
Meta AI
39.4% ±1.0Source ↗
73Qwen2-72B Open source
Alibaba
39.1% ±1.0Source ↗
74Claude 3 Opus
Anthropic
37.5% ±1.1Source ↗
75Llama 3.1-70B Open source
Meta AI
36.7% ±1.0Source ↗
76GPT-4 Turbo Preview (January 2024)
OpenAI
35.4% ±1.1Source ↗
77Gemma 2 27B Open source
Google
27.9% ±1.0Source ↗
78WizardLM-2 8x22B Open source
microsoft
25.7% ±0.9Source ↗
79Yi-1.5-34B Open source
01.AI
25.5% ±0.9Source ↗
80Gemini 1.5 Flash (May 2024)
Google DeepMind
25.1% ±0.9Source ↗
81Mistral Large
mistralai
24.5% ±0.9Source ↗
82Mixtral 8x22B Open source
Mistral AI
24.2% ±0.8Source ↗
83GPT-4 (Jun 2023)
OpenAI
23.0% ±0.8Source ↗
84Llama 3.1-8B Open source
Meta AI
22.9% ±0.9Source ↗
85Hermes 2 Theta Llama-3 70B Open source
Nous Research,Arcee AI
22.7% ±0.8Source ↗
86Llama 3-70B Open source
Meta AI
22.6% ±0.8Source ↗
87Gemma 2 9B Open source
Google DeepMind
21.0% ±0.9Source ↗
88Claude 3 Sonnet
Anthropic
18.2% ±0.8Source ↗
89phi-3-medium 14B Open source
Microsoft
17.6% ±0.7Source ↗
90GPT-3.5 Turbo (Nov 2023)
OpenAI
15.9% ±0.7Source ↗
91Ministral 8B Open source
Mistral AI
14.9% ±0.7Source ↗
92Claude 3 Haiku
Anthropic
14.9% ±0.7Source ↗
93Ministral 3B
Mistral AI
14.4% ±0.7Source ↗
94Claude 2
Anthropic
11.7% ±0.7Source ↗
95DBRX Open source
Databricks
11.7% ±0.7Source ↗
96GPT-3.5 Turbo (Jan 2024)
OpenAI
11.6% ±0.6Source ↗
97Gemini 1.0 Pro
Google DeepMind
11.2% ±0.6Source ↗
98Mistral Nemo Open source
Mistral
10.8% ±0.6Source ↗
99Mixtral 8x7B Open source
Mistral AI
10.0% ±0.5Source ↗
100DeepSeek LLM 67B Open source
DeepSeek
6.4% ±0.4Source ↗
101Llama 3-8B Open source
Meta AI
6.1% ±0.4Source ↗
102Yi-34B Open source
01.AI
5.1% ±0.3Source ↗
103Mistral 7B v0.3 Open source
Mistral AI
3.7% ±0.3Source ↗
104Llama 2-70B Open source
Meta AI
3.3% ±0.3Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.