Skip to content
coding benchmark · included in ECI

WeirdML

Novel, unusual machine-learning tasks solved by writing and running code.
Results
49
Random baseline
0.0%
Score ceiling
100%
Released
16 Jan 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 Open source
MoonshotAI
82.6% ±0.0Source ↗
2GLM 5.3 Open source
Z.ai
75.4% ±0.0Source ↗
3GLM 5.2 Open source
Z.ai
70.1% ±0.0Source ↗
4DeepSeek V4 Pro 0813 Open source
DeepSeek
66.2% ±0.0Source ↗
5DeepSeek V4 Flash 0731 Open source
DeepSeek
63.0% ±0.0Source ↗
6GLM 5.1 Open source
Z.ai
57.1% ±0.0Source ↗
7Kimi K2.6 Open source
MoonshotAI
55.9% ±0.0Source ↗
8Kimi K2.7 Code Open source
MoonshotAI
54.1% ±0.0Source ↗
9Gemma 4 31B Open source
Google
52.3% ±0.0Source ↗
10DeepSeek v4 Pro (high) Open source
DeepSeek
48.9% ±0.0Source ↗
11GLM 5 Open source
Z.ai
48.2% ±0.0Source ↗
12gpt-oss-120b Open source
OpenAI
48.2%Source ↗
13DeepSeek-V3.2-Speciale Open source
DeepSeek
46.7% ±0.0Source ↗
14DeepSeek v4 Flash (max) Open source
DeepSeek
45.6% ±0.0Source ↗
15Kimi K2.5 Open source
MoonshotAI
45.6% ±0.0Source ↗
16Mistral Medium 3.5 Open source
Mistral
43.7% ±0.0Source ↗
17Nemotron 3 Ultra Open source
NVIDIA
43.5% ±0.0Source ↗
18Kimi K2 Thinking Open source
MoonshotAI
42.8% ±0.0Source ↗
19DeepSeek-R1 (May 2025) Open source
DeepSeek
41.6% ±0.0Source ↗
20Qwen3 Coder 480B A35B Open source
Qwen
41.2% ±0.0Source ↗
21Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
41.0%Source ↗
22gpt-oss-20b Open source
OpenAI
40.9% ±0.0Source ↗
23GLM-4.5 Thinking Open source
Z.ai (Zhipu AI),Tsinghua University
40.6% ±0.0Source ↗
24Qwen3.5-27B Open source
Qwen
39.5% ±0.0Source ↗
25DeepSeek V3.2 Exp Open source
DeepSeek
39.5% ±0.0Source ↗
26Kimi K2 (Jul 2025) Open source
Moonshot
39.4% ±0.0Source ↗
27Kimi K2 Instruct Open source
Moonshot
39.4%Source ↗
28Qwen3 235B A22B Thinking 2507 Open source
Qwen
38.7% ±0.0Source ↗
29Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
38.7%Source ↗
30DeepSeek V3.1 Open source
DeepSeek
38.4% ±0.0Source ↗
31Nemotron 3 Super Open source
NVIDIA
38.0% ±0.0Source ↗
32Qwen3 235B A22B Open source
Qwen
37.3% ±0.0Source ↗
33MiniMax M2.7 Open source
MiniMax
37.0% ±0.0Source ↗
34Kimi K2 (Sep 2025) Open source
Moonshot
36.7% ±0.0Source ↗
35R1 Open source
DeepSeek
36.5% ±0.0Source ↗
36DeepSeek-V3 (Mar 2025) Open source
DeepSeek
36.1% ±0.0Source ↗
37Gemma 4 26B A4B Open source
Google
35.2% ±0.0Source ↗
38Qwen3.6 35B A3B Open source
Qwen
34.5% ±0.0Source ↗
39Qwen3 Coder Next Open source
Qwen
34.4% ±0.0Source ↗
40Inkling Open source
Thinking Machines
32.3% ±0.0Source ↗
41Qwen3 30B A3B Open source
Qwen
29.8%Source ↗
42Llama 4 Maverick Open source
Meta
24.5% ±0.0Source ↗
43Llama 3.1-405B Open source
Meta AI
21.4% ±0.0Source ↗
44Qwen2.5-72B Open source
Alibaba
16.0% ±0.0Source ↗
45Llama 3.3 70B Open source
Meta AI
14.4% ±0.0Source ↗
46Qwen2-72B Open source
Alibaba
11.3% ±0.0Source ↗
47Llama 3.1-70B Open source
Meta AI
9.0% ±0.0Source ↗
48Mixtral 8x22B Open source
Mistral AI
3.2% ±0.0Source ↗
49Llama 3.1-8B Open source
Meta AI
1.7% ±0.0Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.