Skip to content
other benchmark · included in ECI

ARC AI2

ARC AI2 benchmark (score column: Challenge score).
Results
45
Random baseline
25.0%
Score ceiling
100%
Released
14 Mar 2018

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V3 Open source
DeepSeek
95.3%DeepSeek-V3 Technical Report ↗
2Llama 3.1-405B Open source
Meta AI
95.3%DeepSeek-V3 Technical Report ↗
3Qwen2.5-72B Open source
Alibaba
94.5%DeepSeek-V3 Technical Report ↗
4DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
92.2%DeepSeek-V3 Technical Report ↗
5phi-3-medium 14B Open source
Microsoft
91.6%Phi-3 Technical Report: A H… ↗
6phi-3-small 7.4B Open source
Microsoft
90.7%Phi-3 Technical Report: A H… ↗
7Mixtral 8x7B Open source
Mistral AI
87.3%Phi-3 Technical Report: A H… ↗
8Stable Beluga 2 Open source
Stability AI
86.1%Qwen Technical Report ↗
9phi-3-mini 3.8B Open source
Microsoft
84.9%Phi-3 Technical Report: A H… ↗
10Qwen-14B Open source
Alibaba
84.4%Qwen Technical Report ↗
11Llama 3-8B Open source
Meta AI
82.8%Phi-3 Technical Report: A H… ↗
12Mistral 7B v0.1 Open source
Mistral AI
78.6%Phi-3 Technical Report: A H… ↗
13Gemma 7B Open source
Google DeepMind
78.3%Phi-3 Technical Report: A H… ↗
14Llama 2-70B Open source
Meta AI
78.3%Qwen Technical Report ↗
15Phi-2 Open source
Microsoft
75.9%Phi-3 Technical Report: A H… ↗
16Qwen-7B Open source
Alibaba
75.3%Qwen Technical Report ↗
17Qwen2.5-Coder-32B Open source
Alibaba
70.5%Qwen2.5-Coder Technical Rep… ↗
18LLaMA-65B Open source
Meta AI
69.5%Qwen Technical Report ↗
19Falcon-180B Open source
Technology Innovation Institute
67.8%The Falcon Series of Open L… ↗
20LLaMA-33B Open source
Meta AI
67.5%Qwen Technical Report ↗
21DeepSeek-Coder-V2 236B Open source
DeepSeek
64.3%Qwen2.5-Coder Technical Rep… ↗
22Falcon-40B Open source
Technology Innovation Institute
61.9%Falcon2-11B Technical Report ↗
23Qwen2.5-Coder (7B) Open source
Alibaba
60.9%Qwen2.5-Coder Technical Rep… ↗
24Llama 2-13B Open source
Meta AI
60.3%Qwen Technical Report ↗
25LLaMA-13B Open source
Meta AI
52.7%Qwen Technical Report ↗
26MPT-30B Open source
MosaicML
50.6%Llama 2: Open Foundation an… ↗
27Yi 6B Open source
01.AI
50.3%Yi: Open Foundation Models … ↗
28Falcon-7B Open source
Technology Innovation Institute
47.9%Falcon2-11B Technical Report ↗
29LLaMA-7B Open source
Meta AI
47.6%Qwen Technical Report ↗
30StarCoder 2 15B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
47.2%Qwen2.5-Coder Technical Rep… ↗
31Llama 2-7B Open source
Meta AI
45.9%The Falcon Series of Open L… ↗
32Qwen2.5-Coder (1.5B) Open source
Alibaba
45.2%Qwen2.5-Coder Technical Rep… ↗
33Phi-1.5 Open source
Microsoft
44.4%Textbooks Are All You Need … ↗
34MPT-7B Open source
MosaicML
42.6%Qwen Technical Report ↗
35DeepSeek Coder 33B Open source
DeepSeek,Peking University
42.2%Qwen2.5-Coder Technical Rep… ↗
36Gemma 2B Open source
Google DeepMind
42.1%Gemma: Open Models Based on… ↗
37XGen-7B Open source
Salesforce
41.2%XGen-7B Technical Report ↗
38Dolly 2.0-12b Open source
Databricks
39.6%XGen-7B Technical Report ↗
39StarCoder 2 7B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
38.7%Qwen2.5-Coder Technical Rep… ↗
40Baichuan2-13B Open source
Baichuan
38.0%Qwen Technical Report ↗
41DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
36.4%Qwen2.5-Coder Technical Rep… ↗
42StarCoder 2 3B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
34.2%Qwen2.5-Coder Technical Rep… ↗
43Baichuan 2-7B Open source
Baichuan
32.5%Qwen Technical Report ↗
44Cerebras-GPT-13B Open source
Cerebras Systems
32.4%XGen-7B Technical Report ↗
45DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
25.4%Qwen2.5-Coder Technical Rep… ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.