Skip to content
coding benchmark · included in ECI

SWE-Bench verified

500 human-validated real GitHub issues; the model must produce a patch that passes tests.
Results
6
Random baseline
0.0%
Score ceiling
100%
Released
13 Aug 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GLM 5.2 Open source
Z.ai
78.7% ±1.9Log ↗
2DeepSeek v4 Pro (high) Open source
DeepSeek
77.6% ±1.9Log ↗
3Kimi K2.6 Open source
MoonshotAI
76.7% ±1.9Log ↗
4GLM 5.1 Open source
Z.ai
74.2% ±2.0Source ↗
5Kimi K2.5 Open source
MoonshotAI
73.8% ±2.0Log ↗
6GLM 5 Open source
Z.ai
72.1% ±2.1Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.