Skip to content
other benchmark · included in ECI

FrontierSWE

FrontierSWE benchmark (score column: Score).
Results
15
Random baseline
0.0%
Score ceiling
100%
Released
2 Sep 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
65.5%Source ↗
2Claude Opus 5.5
Anthropic
62.3%Source ↗
3Claude Fable 5.1
Anthropic
56.3%Source ↗
4Claude Opus 5
Anthropic
52.0%Source ↗
5Claude Fable 5
Anthropic
47.0%Source ↗
6GPT-5.6 Sol
OpenAI
32.2%Source ↗
7GLM 5.3 Open source
Z.ai
30.2%Source ↗
8Grok 4.7 (xhigh)
xAI
29.5%Source ↗
9Kimi K3 Open source
MoonshotAI
25.9%Source ↗
10Grok 4.6 (xhigh)
xAI
25.3%Source ↗
11Gemini 3.7 Flash
Google
20.3%Source ↗
12Gemini 3.8 Flash
Google
19.6%Source ↗
13Qwen3.8 Max (xhigh)
Alibaba
15.8%Source ↗
14Muse Spark 1.2 (xhigh)
Meta AI
12.0%Source ↗
15Inkling (xhigh) Open source
Thinking Machines
4.1%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.