Skip to content
agents benchmark · included in ECI

LMCA

LMCA benchmark (score column: Score).
Results
167
Random baseline
0.0%
Score ceiling
85%
Released
12 Aug 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Claude Opus 5.5
Anthropic
68.2%Source ↗
2Claude Fable 5.1 (unknown)
Anthropic
65.5%Source ↗
3Claude Fable 5.1 (medium)
Anthropic
65.3%Source ↗
4Claude Fable 5.1
Anthropic
65.1%Source ↗
5Claude Fable 5.1 (xhigh)
Anthropic
65.1%Source ↗
6Claude Opus 5 (xhigh)
Anthropic
64.5%Source ↗
7GPT-6 Astra (xhigh)
OpenAI
64.4%Source ↗
8GPT-6 Astra (unknown thinking)
OpenAI
64.1%Source ↗
9GPT-6 Astra
OpenAI
63.8%Source ↗
10Claude Opus 5
Anthropic
63.7%Source ↗
11Claude Fable 5.1 (low)
Anthropic
63.5%Source ↗
12GPT-6 Astra (medium)
OpenAI
62.9%Source ↗
13Claude Opus 5 (medium)
Anthropic
62.9%Source ↗
14Claude Opus 5 (low)
Anthropic
62.6%Source ↗
15GPT-6 Astra (low)
OpenAI
62.2%Source ↗
16Claude Fable 5
Anthropic
61.2%Source ↗
17Claude Fable 5 (xhigh)
Anthropic
61.0%Source ↗
18Claude Fable 5 (medium)
Anthropic
60.3%Source ↗
19Claude Fable 5 (low)
Anthropic
59.6%Source ↗
20GPT-5.6 Sol (pro, max)
OpenAI
59.2%Source ↗
21GPT-6 Sol
OpenAI
59.1%Source ↗
22GPT-5.6 Sol (xhigh)
OpenAI
58.5%Source ↗
23GPT-5.6 Sol
OpenAI
58.4%Source ↗
24Claude Opus 4.8
Anthropic
57.5%Source ↗
25GPT-5.6 Sol (medium)
OpenAI
56.4%Source ↗
26GPT-5.6 Sol (low)
OpenAI
55.9%Source ↗
27Claude Opus 4.6
Anthropic
55.8%Source ↗
28GLM-5.3 (unknown thinking)
Z.ai (Zhipu AI)
55.5%Source ↗
29GPT-5.6 Terra
OpenAI
54.9%Source ↗
30GPT-5.5 (xhigh)
OpenAI
54.3%Source ↗
31GPT-5.5 Pro (xhigh)
OpenAI
53.9%Source ↗
32Muse Spark 1.3 (unknown)
Meta AI
53.9%Source ↗
33Gemini 3.1 Pro Preview
Google
53.8%Source ↗
34Gemini 3.8 Flash (medium)
Google DeepMind
52.9%Source ↗
35GPT-5.6 Sol (none)
OpenAI
52.8%Source ↗
36Kimi K3 Open source
MoonshotAI
52.7%Source ↗
37GPT-5.6 Terra (xhigh)
OpenAI
52.2%Source ↗
38Claude Opus 4.7
Anthropic
52.2%Source ↗
39GPT-5.4 (xhigh)
OpenAI
52.0%Source ↗
40Gemini 3.8 Flash (unknown)
Google DeepMind
51.5%Source ↗
41Gemini 3.8 Flash (low)
Google DeepMind
51.2%Source ↗
42Gemini 3.7 Flash
Google
50.4%Source ↗
43Claude Sonnet 5
Anthropic
50.0%Source ↗
44Muse Spark 1.1
Meta
49.9%Source ↗
45Claude Sonnet 5 (medium)
Anthropic
49.7%Source ↗
46Claude Sonnet 5 (low)
Anthropic
49.6%Source ↗
47GPT-5.6 Terra (medium)
OpenAI
49.6%Source ↗
48GPT-5.6 Terra (low)
OpenAI
49.3%Source ↗
49Gemini 3.7 Flash (medium)
Google DeepMind
49.2%Source ↗
50Claude Sonnet 5 (xhigh)
Anthropic
48.8%Source ↗
51GPT-5.6 Luna
OpenAI
48.5%Source ↗
52GPT-5.6 Luna (xhigh)
OpenAI
48.5%Source ↗
53Grok 4.6 (xhigh)
xAI
48.5%Source ↗
54Muse Spark 1.2 (xhigh)
Meta AI
48.4%Source ↗
55Gemini 3.5 Flash
Google
47.1%Source ↗
56Gemini 3.7 Flash (low)
Google DeepMind
47.1%Source ↗
57DeepSeek V4.1 Flash (unknown) Open source
DeepSeek
47.0%Source ↗
58GPT-5.6 Terra (none)
OpenAI
46.5%Source ↗
59Claude Sonnet 4.6
Anthropic
46.5%Source ↗
60Qwen3.8 Max (xhigh)
Alibaba
46.2%Source ↗
61GLM 5.2 Open source
Z.ai
45.8%Source ↗
62DeepSeek V4 Pro 0813 (unknown) Open source
DeepSeek
45.5%Source ↗
63Grok 4.5
SpaceXAI
45.2%Source ↗
64Gemini 3.6 Flash
Google
44.9%Source ↗
65GPT-6 Luna
OpenAI
44.5%Source ↗
66Claude Opus 4.5
Anthropic
44.5%Source ↗
67GPT-5.6 Luna (medium)
OpenAI
44.3%Source ↗
68Qwen3.7 Max
Qwen
44.0%Source ↗
69GPT-5.2 (xhigh)
OpenAI
43.9%Source ↗
70GPT-5.1
OpenAI
43.9%Source ↗
71GPT-5.6 Luna (low)
OpenAI
43.8%Source ↗
72Gemini 3 Flash Preview
Google
43.1%Source ↗
73Qwen 3.6 Max (Preview)
Alibaba
42.5%Source ↗
74DeepSeek V4 Flash 0731 Open source
DeepSeek
41.7%Source ↗
75GPT-5.6 Luna (none)
OpenAI
41.4%Source ↗
76Qwen3.8 27B Open source
Qwen
41.4%Source ↗
77DeepSeek v4 Pro (high) Open source
DeepSeek
41.2%Source ↗
78GPT-5.4 mini (xhigh)
OpenAI
40.8%Source ↗
79GPT-5
OpenAI
40.0%Source ↗
80o3
OpenAI
39.7%Source ↗
81Gemma 4 31B Open source
Google
39.3%Source ↗
82Claude Sonnet 4.5 (unknown thinking)
Anthropic
38.8%Source ↗
83Grok 4.20
SpaceXAI
38.7%Source ↗
84o3 Pro
OpenAI
38.5%Source ↗
85Grok 4.3 Beta
xAI
38.3%Source ↗
86Qwen3.5 397B A17B Open source
Qwen
37.9%Source ↗
87Gemini 3.5 Flash Lite
Google
37.6%Source ↗
88Inkling (xhigh) Open source
Thinking Machines
37.6%Source ↗
89Qwen3.7 Plus
Qwen
37.6%Source ↗
90Claude Opus 4
Anthropic
37.4%Source ↗
91Kimi K2.6 Open source
MoonshotAI
37.3%Source ↗
92Claude Opus 4.1 (unknown thinking)
Anthropic
37.1%Source ↗
93Nemotron 3 Ultra Open source
NVIDIA
36.9%Source ↗
94GPT-5.4 nano (xhigh)
OpenAI
36.9%Source ↗
95Qwen3.5 Plus 2026-02-15
Qwen
36.4%Source ↗
96DeepSeek v4 Flash (max) Open source
DeepSeek
35.9%Source ↗
97Gemini 3.1 Flash Lite
Google
35.0%Source ↗
98Gemini 2.5 Pro (Jun 2025)
Google DeepMind
34.8%Source ↗
99Qwen3.6 27B Open source
Qwen
34.5%Source ↗
100GPT-5 Mini
OpenAI
34.2%Source ↗
101Qwen3.5-27B Open source
Qwen
34.0%Source ↗
102MiniMax M3 Open source
MiniMax
33.7%Source ↗
103Qwen 3.6 Plus (2026-04-02)
Alibaba
33.1%Source ↗
104Qwen3.5-122B-A10B Open source
Qwen
32.2%Source ↗
105Qwen 3.6 Flash (2026-04-16)
Alibaba
31.0%Source ↗
106Claude Haiku 4.5 (unknown thinking)
Anthropic
30.9%Source ↗
107Qwen3.6 35B A3B Open source
Qwen
29.7%Source ↗
108Gemma 4 26B A4B Open source
Google
29.7%Source ↗
109MiMo-V2.5-Pro Open source
Xiaomi
29.5%Source ↗
110Qwen3.5-35B-A3B Open source
Qwen
29.5%Source ↗
111Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
29.3%Source ↗
112Qwen3.5-Flash
Qwen
29.1%Source ↗
113DeepSeek V3.2 Exp Open source
DeepSeek
29.1%Source ↗
114Claude Sonnet 4 (unknown thinking)
Anthropic
29.0%Source ↗
115DeepSeek-V3.2 (Thinking; Novita) Open source
DeepSeek
28.8%Source ↗
116DeepSeek V3.1 Terminus Open source
DeepSeek
28.6%Source ↗
117Qwen3-Max-Instruct
Alibaba
28.3%Source ↗
118Gemini 2.5 Flash (Jun 2025)
Google DeepMind
27.5%Source ↗
119o4 Mini
OpenAI
26.5%Source ↗
120Mistral Medium 3.5 Open source
Mistral
26.1%Source ↗
121GPT-4.1
OpenAI
25.6%Source ↗
122Qwen3 235B A22B Open source
Qwen
25.0%Source ↗
123Qwen3.5-9B Open source
Qwen
24.5%Source ↗
124DeepSeek V3.1 Open source
DeepSeek
24.3%Source ↗
125Qwen Plus (Apr 2025)
Alibaba
24.0%Source ↗
126Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
23.5%Source ↗
127Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
22.4%Source ↗
128o1
OpenAI
22.3%Source ↗
129gpt-oss-120b Open source
OpenAI
22.1%Source ↗
130GPT-4.1 Mini
OpenAI
21.1%Source ↗
131Mistral Small 4 Open source
Mistral
20.6%Source ↗
132Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
19.5%Source ↗
133Mistral Medium 3.1
Mistral
19.1%Source ↗
134o3 Mini
OpenAI
19.0%Source ↗
135Qwen3 14B Open source
Qwen
18.2%Source ↗
136gemini-2.5-flash-lite-preview-06-17 (Default thinking length)
Google DeepMind
18.1%Source ↗
137Llama 3.3 70B Open source
Meta AI
17.5%Source ↗
138Qwen3 32B Open source
Qwen
17.3%Source ↗
139GPT-4 (Jun 2023)
OpenAI
17.1%Source ↗
140Claude 3 Opus
Anthropic
17.0%Source ↗
141Mistral Large 3 Open source
Mistral AI
16.7%Source ↗
142GPT-4o (May 2024)
OpenAI
16.6%Source ↗
143Llama 4 Maverick Open source
Meta
15.9%Source ↗
144Qwen3 30B A3B Open source
Qwen
15.8%Source ↗
145DeepSeek-V3 (Mar 2025) Open source
DeepSeek
15.5%Source ↗
146DeepSeek V3.2 Open source
DeepSeek
15.2%Source ↗
147Llama 3.1-70B Open source
Meta AI
14.8%Source ↗
148gpt-oss-20b Open source
OpenAI
14.5%Source ↗
149Qwen2.5-72B Open source
Alibaba
13.4%Source ↗
150Gemma 3 27B Open source
Google
12.3%Source ↗
151Llama 4 Scout Open source
Meta
12.0%Source ↗
152GPT-4o-mini
OpenAI
10.4%Source ↗
153Cohere Command A Open source
Cohere
10.3%Source ↗
154GPT-4 Turbo (Nov 2023)
OpenAI
9.8%Source ↗
155GPT-3.5 Turbo (Jan 2024)
OpenAI
9.7%Source ↗
156c4ai-command-r-08-2024
9.2%Source ↗
157Claude 3 Haiku
Anthropic
8.8%Source ↗
158Qwen3 8B Open source
Qwen
8.8%Source ↗
159GPT-5 Nano
OpenAI
7.9%Source ↗
160Gemma 2 27B Open source
Google
7.1%Source ↗
161Qwen2.5-7B Open source
Alibaba
6.4%Source ↗
162Ministral 3B
Mistral AI
5.5%Source ↗
163GPT-4.1 Nano
OpenAI
5.5%Source ↗
164Llama 3.1-8B Open source
Meta AI
5.4%Source ↗
165Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
5.0%Source ↗
166Gemma 3 12B Open source
Google
4.5%Source ↗
167Gemma 3 4B Open source
Google
2.8%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.