Skip to content
reasoning benchmark · included in ECI

SimpleBench

Trick questions on spatio-temporal and social reasoning where humans outperform models.
Results
26
Random baseline
16.7%
Score ceiling
100%
Released
31 Oct 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V4 Flash 0731 (unknown) Open source
DeepSeek
61.1%Source ↗
2Kimi K3 Open source
MoonshotAI
60.7%Source ↗
3GLM 5.2 Open source
Z.ai
58.8%Source ↗
4Kimi K2.7 Code Open source
MoonshotAI
57.9%Source ↗
5GLM 5.1 Open source
Z.ai
55.1%Source ↗
6GLM 5 Open source
Z.ai
53.2%Source ↗
7DeepSeek-V3.2-Speciale Open source
DeepSeek
52.6%Source ↗
8Inkling Open source
Thinking Machines
50.0%Source ↗
9GLM-4.7 (Novita) Open source
Z.ai (Zhipu AI)
47.7%Source ↗
10GLM 4.7 Open source
Z.ai
47.7%Source ↗
11Kimi K2.5 Open source
MoonshotAI
46.8%Source ↗
12DeepSeek v4 (unknown) Open source
DeepSeek
46.3%Source ↗
13MiniMax M3 Open source
MiniMax
45.8%Source ↗
14DeepSeek-R1 (May 2025) Open source
DeepSeek
40.8%Source ↗
15DeepSeek V3.1 Open source
DeepSeek
40.0%Source ↗
16Qwen3 235B A22B Open source
Qwen
31.0%Source ↗
17R1 Open source
DeepSeek
30.9%Source ↗
18Llama 4 Maverick Open source
Meta
27.7%Source ↗
19DeepSeek-V3 (Mar 2025) Open source
DeepSeek
27.2%Source ↗
20Kimi K2 Instruct Open source
Moonshot
26.3%Source ↗
21Llama 3.1-405B Open source
Meta AI
23.0%Source ↗
22Mistral Large 2 (Jul 2024) Open source
Mistral AI
22.5%Source ↗
23gpt-oss-120b Open source
OpenAI
22.1%Source ↗
24Llama 3.3 70B Open source
Meta AI
19.9%Source ↗
25DeepSeek V3 Open source
DeepSeek
18.9%Source ↗
26Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
17.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.