Skip to content
coding benchmark · included in ECI

SWE-Bench verified

500 human-validated real GitHub issues; the model must produce a patch that passes tests.
Results
33
Random baseline
0.0%
Score ceiling
100%
Released
13 Aug 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Claude Opus 4.7
Anthropic
83.5% ±1.7Log ↗
2GPT-5.5 (xhigh)
OpenAI
80.6% ±1.8Log ↗
3Gemini 3.5 Flash
Google
79.3% ±1.8Log ↗
4Claude Opus 4.6 (no thinking)
Anthropic
78.7% ±1.9Log ↗
5GLM 5.2 Open source
Z.ai
78.7% ±1.9Log ↗
6DeepSeek v4 Pro (high) Open source
DeepSeek
77.6% ±1.9Log ↗
7Qwen3.7 Max
Qwen
77.3% ±1.9Log ↗
8GPT-5.4
OpenAI
76.9% ±1.9Log ↗
9Kimi K2.6 Open source
MoonshotAI
76.7% ±1.9Log ↗
10Qwen 3.6 Max (Preview)
Alibaba
76.7% ±1.9Log ↗
11Claude Opus 4.5 (no thinking)
Anthropic
76.7% ±1.9Log ↗
12Gemini 3.1 Pro Preview
Google
75.6% ±2.0Log ↗
13Gemini 3 Flash Preview
Google
75.4% ±2.0Log ↗
14Claude Sonnet 4.6 (no thinking)
Anthropic
75.2% ±2.0Log ↗
15GPT-5.3-Codex
OpenAI
74.8% ±2.0Log ↗
16GLM 5.1 Open source
Z.ai
74.2% ±2.0Source ↗
17Kimi K2.5 Open source
MoonshotAI
73.8% ±2.0Log ↗
18GPT-5.2
OpenAI
73.8% ±2.0Log ↗
19GPT-5
OpenAI
73.6% ±2.0Log ↗
20Claude Opus 4.1
Anthropic
73.3% ±2.0Log ↗
21Gemini 3 Pro Preview
Google DeepMind
72.9% ±2.0Log ↗
22GLM 5 Open source
Z.ai
72.1% ±2.1Log ↗
23GPT-5 (medium)
OpenAI
71.5% ±2.1Log ↗
24Claude Sonnet 4.5 (no thinking)
Anthropic
71.3% ±2.1Log ↗
25Claude Opus 4
Anthropic
70.7% ±2.1Log ↗
26GPT-5.1
OpenAI
68.0% ±2.1Log ↗
27GPT-5 mini (medium)
OpenAI
64.7% ±2.2Log ↗
28o3 (medium)
OpenAI
62.3% ±2.2Log ↗
29Claude 3.7 Sonnet
Anthropic
61.0% ±2.2Log ↗
30Qwen 3.6 Plus (2026-04-02)
Alibaba
57.9% ±2.2Log ↗
31Gemini 2.5 Pro (Jun 2025)
Google DeepMind
57.6% ±2.3Log ↗
32GPT-4.1
OpenAI
48.5% ±2.3Log ↗
33GPT-4o (Nov 2024)
OpenAI
31.0% ±2.1Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.