| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | GPT-5.4 (xhigh) OpenAI | 27.9% | xhigh | 5 Mar 2026 | — | Source ↗ | |
| 2 | GPT-5.1 OpenAI | 23.7% | high | 13 Nov 2025 | — | Source ↗ | |
| 3 | Grok 4.20 SpaceXAI | 22.2% | — | 17 Feb 2026 | — | Source ↗ | |
| 4 | Claude Opus 4.5 (unknown thinking) Anthropic | 21.1% | unknown | 24 Nov 2025 | — | Source ↗ | |
| 5 | GPT-5.1 (unknown thinking) OpenAI | 21.1% | unknown | 13 Nov 2025 | — | Source ↗ | |
| 6 | Gemini 3.1 Pro Preview Google | 20.8% | — | 19 Feb 2026 | — | Source ↗ | |
| 7 | Claude Opus 4.6 (unknown thinking) Anthropic | 20.7% | unknown | 5 Feb 2026 | — | Source ↗ | |
| 8 | Qwen 3.6 Plus (2026-04-02) Alibaba | 20.3% | — | 31 Mar 2026 | — | Source ↗ | |
| 9 | Qwen3.5 Plus 2026-02-15 Qwen | 19.8% | — | 16 Feb 2026 | — | Source ↗ | |
| 10 | Kimi K2.5 Open source MoonshotAI | 19.3% | — | 27 Jan 2026 | — | Source ↗ | |
| 11 | GLM 5 Open source Z.ai | 18.7% | — | 11 Feb 2026 | — | Source ↗ | |
| 12 | GPT-5.2 (unknown thinking) OpenAI | 18.2% | unknown | 11 Dec 2025 | — | Source ↗ | |
| 13 | GPT-5.2 OpenAI | 18.1% | high | 11 Dec 2025 | — | Source ↗ | |
| 14 | o3 OpenAI | 17.8% | high | 16 Apr 2025 | — | Source ↗ | |
| 15 | Kimi K2 Thinking (Together) Open source Moonshot | 17.6% | — | 6 Nov 2025 | — | Source ↗ | |
| 16 | GLM-4.7 (Novita) Open source Z.ai (Zhipu AI) | 15.9% | — | 22 Dec 2025 | — | Source ↗ | |
| 17 | Gemini 3 Pro Preview Google DeepMind | 15.8% | — | 18 Nov 2025 | — | Source ↗ | |
| 18 | Qwen3-Max-Instruct Alibaba | 14.5% | — | 24 Sep 2025 | — | Source ↗ | |
| 19 | DeepSeek V3.2 Exp Open source DeepSeek | 13.2% | thinking | 29 Sep 2025 | — | Source ↗ | |
| 20 | DeepSeek-V3.2 (Thinking; Novita) Open source DeepSeek | 12.4% | — | 1 Dec 2025 | — | Source ↗ | |
| 21 | Kimi K2 Thinking Open source MoonshotAI | 11.9% | — | 6 Nov 2025 | — | Source ↗ | |
| 22 | MiniMax M2.5 Open source MiniMax | 11.4% | — | 12 Feb 2026 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.