Skip to content
multimodal benchmark · included in ECI

GeoBench

GeoBench benchmark (score column: ACW Country %).
Results
30
Random baseline
0.0%
Score ceiling
100%
Released
1 Mar 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Gemini 3 Flash Preview
Google
88.0%Source ↗
2Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
86.0%Source ↗
3Gemini 3 Pro Preview
Google DeepMind
84.0%Source ↗
4GPT-5 (medium)
OpenAI
81.0%Source ↗
5Gemini 2.5 Pro Exp (Mar 2025)
Google DeepMind
81.0%Source ↗
6o1 (medium)
OpenAI
80.0%Source ↗
7Gemini 2.0 Flash (Feb 2025)
Google DeepMind,Google
77.0%Source ↗
8Gemini 2.5 Flash (May 2025)
Google DeepMind
76.0%Source ↗
9Gemini 1.5 Flash (Sep 2024)
Google DeepMind
76.0%Source ↗
10Claude Opus 4.5 (no thinking)
Anthropic
75.0%Source ↗
11o3 (medium)
OpenAI
74.0%Source ↗
12Gemini 2.5 Flash Preview (Apr 2025)
Google DeepMind
73.0%Source ↗
13GPT-4.1
OpenAI
72.0%Source ↗
14GPT-4o (Nov 2024)
OpenAI
71.0%Source ↗
15Claude 3.7 Sonnet
Anthropic
68.0%Source ↗
16Claude 3.7 Sonnet (15k thinking)
Anthropic
65.0%Source ↗
17o4 Mini
OpenAI
64.0%Source ↗
18o4-mini (medium)
OpenAI
64.0%Source ↗
19GPT-4o-mini
OpenAI
64.0%Source ↗
20Claude 3.5 Sonnet (Oct 2024)
Anthropic
62.0%Source ↗
21Qwen2.5-72B Open source
Alibaba
62.0%Source ↗
22o3
OpenAI
60.0%Source ↗
23Llama 4 Maverick Open source
Meta
52.0%Source ↗
24Gemma 3 27B Open source
Google
52.0%Source ↗
25Llama 3.2 90B Open source
Meta AI
52.0%Source ↗
26Claude Opus 4
Anthropic
49.0%Source ↗
27Grok 4
xAI
45.0%Source ↗
28Claude Sonnet 4
Anthropic
37.0%Source ↗
29Pixtral 12B Open source
Mistral AI
37.0%Source ↗
30Claude 3.5 Haiku (Oct 2024)
Anthropic
34.0%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.