Skip to content
coding benchmark · included in ECI

WeirdML

Novel, unusual machine-learning tasks solved by writing and running code.
Results
149
Random baseline
0.0%
Score ceiling
100%
Released
16 Jan 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra (pro, max)
OpenAI
93.6% ±0.0Source ↗
2GPT-6 Astra
OpenAI
93.3% ±0.0Source ↗
3Claude Fable 5.1
Anthropic
92.9% ±0.0Source ↗
4Claude Fable 5
Anthropic
91.9% ±0.0Source ↗
5Claude Opus 5
Anthropic
91.8% ±0.0Source ↗
6GPT-5.6 Sol (pro, max)
OpenAI
89.4% ±0.0Source ↗
7GPT-5.6 Sol
OpenAI
88.8% ±0.0Source ↗
8GPT-5.5 (xhigh)
OpenAI
84.9% ±0.0Source ↗
9GPT-5.5
OpenAI
83.9% ±0.0Source ↗
10Claude Opus 4.8
Anthropic
82.9% ±0.0Source ↗
11Kimi K3 Open source
MoonshotAI
82.6% ±0.0Source ↗
12GPT-5.3-Codex
OpenAI
79.3%Source ↗
13GPT-5.6 Terra
OpenAI
78.3% ±0.0Source ↗
14Claude Opus 4.6
Anthropic
78.0% ±0.0Source ↗
15Claude Opus 4.6 (unknown thinking)
Anthropic
77.9%Source ↗
16GPT-5.3 Codex (xhigh)
OpenAI
77.9% ±0.0Source ↗
17GPT-5.4 (xhigh)
OpenAI
77.7% ±0.0Source ↗
18Claude Opus 4.7
Anthropic
76.4% ±0.0Source ↗
19Claude Opus 4.7 (no thinking)
Anthropic
76.4% ±0.0Source ↗
20Claude Opus 4.7 (unknown)
Anthropic
76.4%Source ↗
21GLM 5.3 Open source
Z.ai
75.4% ±0.0Source ↗
22GPT-5.2 (xhigh)
OpenAI
72.2% ±0.0Source ↗
23Gemini 3.1 Pro Preview
Google
72.1% ±0.0Source ↗
24GLM 5.2 Open source
Z.ai
70.1% ±0.0Source ↗
25Gemini 3 Pro Preview
Google DeepMind
69.9% ±0.0Source ↗
26Claude Sonnet 5
Anthropic
68.8% ±0.0Source ↗
27Grok 4.6
SpaceXAI
67.3% ±0.0Source ↗
28GPT-5.5 (no thinking)
OpenAI
67.2% ±0.0Source ↗
29DeepSeek V4 Pro 0813 Open source
DeepSeek
66.2% ±0.0Source ↗
30Claude Sonnet 4.6 (medium)
Anthropic
66.1% ±0.0Source ↗
31Claude Opus 4.6 (no thinking)
Anthropic
65.9% ±0.0Source ↗
32Claude Opus 4.5 (16k thinking)
Anthropic
63.7% ±0.0Source ↗
33GPT-5.2 (medium)
OpenAI
63.4% ±0.0Source ↗
34DeepSeek V4 Flash 0731 Open source
DeepSeek
63.0% ±0.0Source ↗
35Gemini 3.5 Flash
Google
62.6% ±0.0Source ↗
36Gemini 3 Flash Preview
Google
61.6% ±0.0Source ↗
37GPT-5.6 Luna
OpenAI
60.9% ±0.0Source ↗
38GPT-5.1
OpenAI
60.8% ±0.0Source ↗
39GPT-5
OpenAI
60.7% ±0.0Source ↗
40GPT-5 Pro
OpenAI
60.4% ±0.0Source ↗
41Muse Spark 1.2 (xhigh)
Meta AI
60.3% ±0.0Source ↗
42GPT-5.4 Mini
OpenAI
60.3% ±0.0Source ↗
43o3 Pro
OpenAI
58.2% ±0.0Source ↗
44GPT-5.4 (none)
OpenAI
57.4% ±0.0Source ↗
45GPT-5.4 Pro (no thinking)
OpenAI
57.4% ±0.0Source ↗
46GLM 5.1 Open source
Z.ai
57.1% ±0.0Source ↗
47Gemini 3.6 Flash
Google
56.1% ±0.0Source ↗
48Kimi K2.6 Open source
MoonshotAI
55.9% ±0.0Source ↗
49GPT-5-codex
OpenAI
54.5%Source ↗
50Kimi K2.7 Code Open source
MoonshotAI
54.1% ±0.0Source ↗
51Gemini 2.5 Pro (Jun 2025)
Google DeepMind
54.0%Source ↗
52GPT-5 Mini
OpenAI
52.7% ±0.0Source ↗
53o4 Mini
OpenAI
52.6% ±0.0Source ↗
54o3
OpenAI
52.4% ±0.0Source ↗
55Gemma 4 31B Open source
Google
52.3% ±0.0Source ↗
56Grok 4.20
SpaceXAI
52.3% ±0.0Source ↗
57Gemini 3.1 Flash Lite
Google
52.2% ±0.0Source ↗
58Grok 4.3 Beta
xAI
49.9% ±0.0Source ↗
59GPT-5.2 (none)
OpenAI
49.6% ±0.0Source ↗
60GPT-5.2 (low)
OpenAI
49.6%Source ↗
61GPT-5.4 Nano
OpenAI
49.2% ±0.0Source ↗
62DeepSeek v4 Pro (high) Open source
DeepSeek
48.9% ±0.0Source ↗
63GLM 5 Open source
Z.ai
48.2% ±0.0Source ↗
64gpt-oss-120b Open source
OpenAI
48.2%Source ↗
65Claude Sonnet 4.5 (16k thinking)
Anthropic
47.7% ±0.0Source ↗
66o1-preview
OpenAI
47.6% ±0.0Source ↗
67DeepSeek-V3.2-Speciale Open source
DeepSeek
46.7% ±0.0Source ↗
68Claude Sonnet 4.5 (no thinking)
Anthropic
46.7% ±0.0Source ↗
69Grok 4.5 (unknown thinking)
xAI
46.4% ±0.0Source ↗
70Claude Sonnet 4
Anthropic
46.1% ±0.0Source ↗
71o1
OpenAI
46.1% ±0.0Source ↗
72Claude Opus 4.1
Anthropic
45.9% ±0.0Source ↗
73Grok 4
xAI
45.7% ±0.0Source ↗
74DeepSeek v4 Flash (max) Open source
DeepSeek
45.6% ±0.0Source ↗
75Kimi K2.5 Open source
MoonshotAI
45.6% ±0.0Source ↗
76Claude Haiku 4.5
Anthropic
45.4% ±0.0Source ↗
77Claude Opus 4
Anthropic
43.7% ±0.0Source ↗
78Mistral Medium 3.5 Open source
Mistral
43.7% ±0.0Source ↗
79o3 Mini
OpenAI
43.7% ±0.0Source ↗
80Nemotron 3 Ultra Open source
NVIDIA
43.5% ±0.0Source ↗
81Mercury 2
Inception
43.2% ±0.0Source ↗
82Grok 4 Fast
xAI
42.9% ±0.0Source ↗
83Kimi K2 Thinking Open source
MoonshotAI
42.8% ±0.0Source ↗
84Grok-3 mini
xAI
42.6%Source ↗
85Gemini 2.5 Flash (Sep 2025)
Google DeepMind
41.9% ±0.0Source ↗
86DeepSeek-R1 (May 2025) Open source
DeepSeek
41.6% ±0.0Source ↗
87Qwen3 Coder 480B A35B Open source
Qwen
41.2% ±0.0Source ↗
88Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
41.0%Source ↗
89Gemini 2.5 Flash (Apr 2025)
Google DeepMind
41.0% ±0.0Source ↗
90Gemini 2.5 Flash (May 2025)
Google DeepMind
40.9%Source ↗
91gpt-oss-20b Open source
OpenAI
40.9% ±0.0Source ↗
92GLM-4.5 Thinking Open source
Z.ai (Zhipu AI),Tsinghua University
40.6% ±0.0Source ↗
93Claude 3.5 Sonnet (Oct 2024)
Anthropic
40.0% ±0.0Source ↗
94Qwen3.5-27B Open source
Qwen
39.5% ±0.0Source ↗
95DeepSeek V3.2 Exp Open source
DeepSeek
39.5% ±0.0Source ↗
96GPT-4.5 Preview (Feb 2025)
OpenAI
39.4% ±0.0Source ↗
97Kimi K2 (Jul 2025) Open source
Moonshot
39.4% ±0.0Source ↗
98Kimi K2 Instruct Open source
Moonshot
39.4%Source ↗
99GPT-4.1
OpenAI
39.0% ±0.0Source ↗
100Gemini 3.5 Flash Lite
Google
39.0% ±0.0Source ↗
101Qwen3 235B A22B Thinking 2507 Open source
Qwen
38.7% ±0.0Source ↗
102Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
38.7%Source ↗
103DeepSeek V3.1 Open source
DeepSeek
38.4% ±0.0Source ↗
104GPT-5 Nano
OpenAI
38.1% ±0.0Source ↗
105Nemotron 3 Super Open source
NVIDIA
38.0% ±0.0Source ↗
106GPT-5.4 nano (no thinking)
OpenAI
38.0% ±0.0Source ↗
107GPT-5.4 mini (none)
OpenAI
37.9% ±0.0Source ↗
108GPT-4.1 Mini
OpenAI
37.6% ±0.0Source ↗
109Qwen3 235B A22B Open source
Qwen
37.3% ±0.0Source ↗
110Grok 3
xAI
37.2% ±0.0Source ↗
111MiniMax M2.7 Open source
MiniMax
37.0% ±0.0Source ↗
112Kimi K2 (Sep 2025) Open source
Moonshot
36.7% ±0.0Source ↗
113R1 Open source
DeepSeek
36.5% ±0.0Source ↗
114o1-mini (medium)
OpenAI
36.3% ±0.0Source ↗
115DeepSeek-V3 (Mar 2025) Open source
DeepSeek
36.1% ±0.0Source ↗
116Gemini 2.5 Flash-Lite (Jun 2025)
Google DeepMind
35.2%Source ↗
117gemini-2.5-flash-lite-preview-06-17 (Default thinking length)
Google DeepMind
35.2% ±0.0Source ↗
118Gemma 4 26B A4B Open source
Google
35.2% ±0.0Source ↗
119grok-code-fast-1
xAI
35.1% ±0.0Source ↗
120Qwen3.6 35B A3B Open source
Qwen
34.5% ±0.0Source ↗
121Qwen3 Coder Next Open source
Qwen
34.4% ±0.0Source ↗
122Mistral Medium 3.1
Mistral
33.1% ±0.0Source ↗
123Inkling Open source
Thinking Machines
32.3% ±0.0Source ↗
124Claude 3.5 Sonnet (Jun 2024)
Anthropic
31.0% ±0.0Source ↗
125Claude 3.5 Haiku (Oct 2024)
Anthropic
30.7% ±0.0Source ↗
126Qwen3 30B A3B Open source
Qwen
29.8%Source ↗
127GPT-5 nano (low)
OpenAI
25.9% ±0.0Source ↗
128Gemini 2.0 Flash (Feb 2025)
Google DeepMind,Google
25.8% ±0.0Source ↗
129GPT-4o (Nov 2024)
OpenAI
25.1% ±0.0Source ↗
130Gemini 1.5 Flash (Sep 2024)
Google DeepMind
24.9% ±0.0Source ↗
131Llama 4 Maverick Open source
Meta
24.5% ±0.0Source ↗
132Grok-2 (Dec 2024)
xAI
22.2% ±0.0Source ↗
133Gemini 1.5 Pro (Sept 2024)
Google DeepMind
22.2% ±0.0Source ↗
134Llama 3.1-405B Open source
Meta AI
21.4% ±0.0Source ↗
135Claude 3 Opus
Anthropic
19.2% ±0.0Source ↗
136GPT-4.1 Nano
OpenAI
19.0% ±0.0Source ↗
137GPT-4 Turbo (Apr 2024)
OpenAI
18.0% ±0.0Source ↗
138Qwen2.5-72B Open source
Alibaba
16.0% ±0.0Source ↗
139Llama 3.3 70B Open source
Meta AI
14.4% ±0.0Source ↗
140GPT-4 (Jun 2023)
OpenAI
12.4% ±0.0Source ↗
141GPT-4o-mini
OpenAI
11.8% ±0.0Source ↗
142Qwen2-72B Open source
Alibaba
11.3% ±0.0Source ↗
143Claude 3 Sonnet
Anthropic
10.2% ±0.0Source ↗
144Claude 3 Haiku
Anthropic
9.8% ±0.0Source ↗
145Llama 3.1-70B Open source
Meta AI
9.0% ±0.0Source ↗
146Claude 2.1
Anthropic
7.1% ±0.0Source ↗
147GPT-3.5 Turbo (Jan 2024)
OpenAI
3.5% ±0.0Source ↗
148Mixtral 8x22B Open source
Mistral AI
3.2% ±0.0Source ↗
149Llama 3.1-8B Open source
Meta AI
1.7% ±0.0Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.