Skip to content
math benchmark · included in ECI

GSM8K

GSM8K benchmark (score column: EM).
Results
44
Random baseline
0.0%
Score ceiling
100%
Released
27 Oct 2021

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek-Coder-V2 236B Open source
DeepSeek
94.5%Source ↗
2Qwen2.5 Coder 32B Instruct Open source
qwen
93.0%Source ↗
3Qwen2.5-Coder-32B Open source
Alibaba
91.1%Source ↗
4Phi-3.5-MoE Open source
Microsoft
88.7%Source ↗
5Qwen2.5-Coder (7B) Open source
Alibaba
86.7%Source ↗
6Phi-3.5-mini Open source
Microsoft
86.2%Source ↗
7Gemma 2 9B Open source
Google DeepMind
84.9%Source ↗
8Mistral Nemo Open source
Mistral
84.2%Source ↗
9Llama 3.1-8B Open source
Meta AI
82.4%Source ↗
10Yi-34B Open source
01.AI
76.0%Source ↗
11Mixtral 8x7B Open source
Mistral AI
74.4%Source ↗
12Stable Beluga 2 Open source
Stability AI
69.6%Source ↗
13Llama 2-70B Open source
Meta AI
69.6%Source ↗
14Qwen2.5-Coder (1.5B) Open source
Alibaba
65.8%Source ↗
15Qwen-14B Open source
Alibaba
61.3%Source ↗
16StarCoder 2 15B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
57.7%Source ↗
17Mistral 7B v0.1 Open source
Mistral AI
54.4%Source ↗
18Falcon-180B Open source
Technology Innovation Institute
54.4%Source ↗
19LLaMA-65B Open source
Meta AI
54.4%Source ↗
20Falcon 2 11B Open source
Technology Innovation Institute
53.8%Source ↗
21Baichuan2-13B Open source
Baichuan
52.8%Source ↗
22Qwen-7B Open source
Alibaba
51.7%Source ↗
23Gemma 7B Open source
Google DeepMind
46.4%Source ↗
24Yi 6B Open source
01.AI
44.9%Source ↗
25LLaMA-33B Open source
Meta AI
44.1%Source ↗
26Llama 2-13B Open source
Meta AI
36.9%Source ↗
27Mistral 7B v0.2 Open source
Mistral AI
35.4%Source ↗
28DeepSeek Coder 33B Open source
DeepSeek,Peking University
35.4%Source ↗
29MPT-30B Open source
MosaicML
34.4%Source ↗
30Falcon-40B Open source
Technology Innovation Institute
33.8%Source ↗
31StarCoder 2 7B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
32.7%Source ↗
32Baichuan 1-13B Open source
Baichuan
26.8%Source ↗
33Baichuan 2-7B Open source
Baichuan
24.6%Source ↗
34Vicuna-13B-v1.3 Open source
Large Model Systems Organization,University of California (UC) Berkeley
22.6%Source ↗
35StarCoder 2 3B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
21.6%Source ↗
36DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
21.3%Source ↗
37LLaMA-13B Open source
Meta AI
20.5%Source ↗
38Gemma 2B Open source
Google DeepMind
17.7%Source ↗
39Llama 2-7B Open source
Meta AI
16.7%Source ↗
40LLaMA-7B Open source
Meta AI
11.0%Source ↗
41Baichuan1-7B Open source
Baichuan
9.2%Source ↗
42MPT-7B Open source
MosaicML
9.1%Source ↗
43Falcon-7B Open source
Technology Innovation Institute
6.8%Source ↗
44DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
4.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.