Skip to content
games benchmark · included in ECI

Balrog

Balrog benchmark (score column: Average progress).
Results
39
Random baseline
0.0%
Score ceiling
100%
Released
20 Nov 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
68.3%Source ↗
2Claude Opus 5
Anthropic
63.4%Source ↗
3GPT-5.6 Sol
OpenAI
60.0%Source ↗
4Gemini 3 Pro Preview
Google DeepMind
58.1%Source ↗
5Gemini 3.1 Pro Preview
Google
57.0%Source ↗
6GPT-5.6 Terra
OpenAI
53.2%Source ↗
7Gemini 3 Flash Preview
Google
48.1%Source ↗
8GPT-5.6 Luna
OpenAI
45.6%Source ↗
9Grok 4
xAI
43.6%Source ↗
10Claude Opus 4.5 (no thinking)
Anthropic
43.5%Source ↗
11Gemini 2.5 Pro Exp (Mar 2025)
Google DeepMind
43.3%Source ↗
12Claude Opus 4.5 (64k thinking)
Anthropic
43.0%Source ↗
13Claude Opus 4.5 (unknown thinking)
Anthropic
43.0%Source ↗
14R1 Open source
DeepSeek
34.9%Source ↗
15Gemini 2.5 Flash (Jun 2025)
Google DeepMind
33.5%Source ↗
16GPT-5 (minimal)
OpenAI
32.8%Source ↗
17Claude 3.5 Sonnet (Oct 2024)
Anthropic
32.6%Source ↗
18GPT-4o (May 2024)
OpenAI
32.3%Source ↗
19Claude Haiku 4.5
Anthropic
31.2%Source ↗
20Grok 3
xAI
29.5%Source ↗
21Reka Flash 3 Open source
rekaai
29.2%Source ↗
22Llama 3.1-70B Open source
Meta AI
27.9%Source ↗
23Llama 3.2 90B Open source
Meta AI
27.3%Source ↗
24Llama 3.3 70B Open source
Meta AI
23.0%Source ↗
25Gemini 1.5 Pro (Sept 2024)
Google DeepMind
21.0%Source ↗
26DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
19.5%Source ↗
27Claude 3.5 Haiku (Oct 2024)
Anthropic
19.3%Source ↗
28Mistral Nemo Open source
Mistral
17.6%Source ↗
29GPT-4o-mini
OpenAI
17.4%Source ↗
30Llama 3.2 11B Open source
Meta AI
16.8%Source ↗
31Qwen2.5-72B Open source
Alibaba
16.2%Source ↗
32Llama 3.1-8B Open source
Meta AI
15.1%Source ↗
33Gemini 1.5 Flash (Sep 2024)
Google DeepMind
14.6%Source ↗
34Qwen2-VL-72B-Instruct
12.8%Source ↗
35Phi 4 Open source
Microsoft
11.6%Source ↗
36Llama 3.2 3B Open source
Meta AI
10.1%Source ↗
37Qwen2.5-7B Open source
Alibaba
7.8%Source ↗
38Llama 3.2 1B Open source
Meta AI
6.6%Source ↗
39Qwen2-VL-7B-Instruct
3.7%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.