Skip to content
math benchmark · included in ECI

GSM8K

GSM8K benchmark (score column: EM).
Results
68
Random baseline
0.0%
Score ceiling
100%
Released
27 Oct 2021

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek-Coder-V2 236B Open source
DeepSeek
94.5%Source ↗
2Qwen2.5-Coder-14B-Instruct
94.2%Source ↗
3Qwen2.5 Coder 32B Instruct Open source
qwen
93.0%Source ↗
4GPT-4 (Mar 2023)
OpenAI
92.0%Source ↗
5GPT-4o-mini
OpenAI
91.3%Source ↗
6Qwen2.5-Coder-32B Open source
Alibaba
91.1%Source ↗
7GPT-4 (Jun 2023)
OpenAI
90.0%Source ↗
8Qwen2.5-Coder-14B
88.7%Source ↗
9Phi-3.5-MoE Open source
Microsoft
88.7%Source ↗
10DeepSeek-Coder-V2-Lite-Instruct
87.6%Source ↗
11Qwen2.5-Coder (7B) Open source
Alibaba
86.7%Source ↗
12Claude Instant
Anthropic
86.7%Source ↗
13Phi-3.5-mini Open source
Microsoft
86.2%Source ↗
14Gemma 2 9B Open source
Google DeepMind
84.9%Source ↗
15Mistral Nemo Open source
Mistral
84.2%Source ↗
16Llama 3.1-8B Open source
Meta AI
82.4%Source ↗
17Gemini 1.5 Flash (May 2024)
Google DeepMind
82.4%Source ↗
18Qwen2.5-Coder-3B-Instruct
80.7%Source ↗
19Yi-34B Open source
01.AI
76.0%Source ↗
20Qwen2.5-Coder-3B
75.7%Source ↗
21Mixtral 8x7B Open source
Mistral AI
74.4%Source ↗
22Stable Beluga 2 Open source
Stability AI
69.6%Source ↗
23Llama 2-70B Open source
Meta AI
69.6%Source ↗
24DeepSeek-Coder-V2-Lite-Base
67.1%Source ↗
25Qwen2.5-Coder (1.5B) Open source
Alibaba
65.8%Source ↗
26internlm-20b
62.9%Source ↗
27Qwen-14B Open source
Alibaba
61.3%Source ↗
28GPT-3.5 Turbo (June 2023)
OpenAI
57.8%Source ↗
29StarCoder 2 15B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
57.7%Source ↗
30Mistral 7B v0.1 Open source
Mistral AI
54.4%Source ↗
31Falcon-180B Open source
Technology Innovation Institute
54.4%Source ↗
32LLaMA-65B Open source
Meta AI
54.4%Source ↗
33Falcon 2 11B Open source
Technology Innovation Institute
53.8%Source ↗
34Baichuan2-13B Open source
Baichuan
52.8%Source ↗
35Qwen-7B Open source
Alibaba
51.7%Source ↗
36Gemma 7B Open source
Google DeepMind
46.4%Source ↗
37Nemotron-4 15B
NVIDIA
46.0%Source ↗
38Baichuan2-13B-Chat
45.7%Source ↗
39Yi 6B Open source
01.AI
44.9%Source ↗
40LLaMA-33B Open source
Meta AI
44.1%Source ↗
41Llama 2-34B
Meta AI
42.2%Source ↗
42INTELLECT-1
Prime Intellect,Hugging Face,Arcee AI
38.6%Source ↗
43CodeQwen1.5-7B
37.7%Source ↗
44Llama 2-13B Open source
Meta AI
36.9%Source ↗
45Mistral 7B v0.2 Open source
Mistral AI
35.4%Source ↗
46DeepSeek Coder 33B Open source
DeepSeek,Peking University
35.4%Source ↗
47Qwen2.5-Coder-0.5B
34.5%Source ↗
48MPT-30B Open source
MosaicML
34.4%Source ↗
49Falcon-40B Open source
Technology Innovation Institute
33.8%Source ↗
50StarCoder 2 7B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
32.7%Source ↗
51chatglm2-6b
32.4%Source ↗
52internlm-7b
31.2%Source ↗
53vicuna-13b-v1.1
28.1%Source ↗
54Baichuan 1-13B Open source
Baichuan
26.8%Source ↗
55Baichuan 2-7B Open source
Baichuan
24.6%Source ↗
56Vicuna-13B-v1.3 Open source
Large Model Systems Organization,University of California (UC) Berkeley
22.6%Source ↗
57StarCoder 2 3B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
21.6%Source ↗
58DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
21.3%Source ↗
59Qwen-1_8B
21.2%Source ↗
60LLaMA-13B Open source
Meta AI
20.5%Source ↗
61Gemma 2B Open source
Google DeepMind
17.7%Source ↗
62Llama 2-7B Open source
Meta AI
16.7%Source ↗
63internlm-chat-20b
15.7%Source ↗
64LLaMA-7B Open source
Meta AI
11.0%Source ↗
65Baichuan1-7B Open source
Baichuan
9.2%Source ↗
66MPT-7B Open source
MosaicML
9.1%Source ↗
67Falcon-7B Open source
Technology Innovation Institute
6.8%Source ↗
68DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
4.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.