Skip to content
science benchmark · included in ECI

GPQA diamond

198 graduate-level, 'Google-proof' multiple-choice questions in biology, physics and chemistry.
Results
262
Random baseline
25.0%
Score ceiling
100%
Released
20 Nov 2023

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
95.8% ±1.4Source ↗
2Gemini 3.8 Flash
Google
95.4% ±1.4Source ↗
3Gemini 3.7 Flash
Google
94.8% ±1.3Source ↗
4GPT-5.4 Pro (xhigh)
OpenAI
94.6% ±1.6Source ↗
5Gemini 3.1 Pro Preview
Google
94.4% ±1.6Log ↗
6Gemini 3.6 Flash
Google
94.1% ±1.4Source ↗
7Grok 4.6
SpaceXAI
94.0% ±1.4Source ↗
8GPT-5.5 (xhigh)
OpenAI
94.0% ±1.5Log ↗
9GPT-5.5 Pro (xhigh)
OpenAI
93.9% ±1.6Log ↗
10Claude Opus 5
Anthropic
93.9% ±1.5Source ↗
11GPT-5.6 Sol
OpenAI
93.5% ±1.6Source ↗
12Grok 4.5
SpaceXAI
93.4% ±1.4Source ↗
13GPT-5.6 Terra
OpenAI
93.3% ±1.5Source ↗
14GPT-5.4 (xhigh)
OpenAI
93.3% ±1.8Log ↗
15Grok 4.6 (xhigh)
xAI
93.2% ±1.5Source ↗
16Kimi K3 Open source
MoonshotAI
93.1% ±1.5Source ↗
17Gemini 3.5 Flash
Google
92.8% ±1.6Log ↗
18Qwen3.8 Max (xhigh)
Alibaba
92.7% ±1.7Source ↗
19Gemini 3 Pro Preview
Google DeepMind
92.6% ±1.7Log ↗
20Qwen3.8 Max (0902) (xhigh)
Alibaba
92.3% ±1.7Source ↗
21GLM 5.2 Open source
Z.ai
91.9% ±1.6Source ↗
22DeepSeek V4 Pro 0813 Open source
DeepSeek
91.7% ±1.5Source ↗
23GPT-5.6 Luna
OpenAI
91.6% ±1.7Source ↗
24GPT-5.2 (xhigh)
OpenAI
91.4% ±1.8Log ↗
25DeepSeek V4 Flash 0731 Open source
DeepSeek
91.0% ±1.8Source ↗
26Claude Opus 4.8
Anthropic
91.0% ±1.9Source ↗
27GLM 5.3 Open source
Z.ai
90.9% ±1.6Source ↗
28MiniMax M3 Open source
MiniMax
90.9% ±2.0Log ↗
29Qwen3.7 Max
Qwen
90.9% ±2.0Log ↗
30DeepSeek v4 Pro (high) Open source
DeepSeek
90.9% ±2.0Log ↗
31Kimi K2.6 Open source
MoonshotAI
90.8% ±1.7Log ↗
32GPT-5.5 (low)
OpenAI
90.7% ±1.8Log ↗
33Claude Sonnet 5 (xhigh)
Anthropic
90.5% ±1.8Source ↗
34Claude Opus 4.6 (32k thinking)
Anthropic
90.5% ±1.7Log ↗
35GLM 5.3 Flash Open source
Z.ai
90.2% ±1.7Source ↗
36Claude Opus 4.7 (xhigh)
Anthropic
90.2% ±1.8Log ↗
37GPT-5.6 Sol (low)
OpenAI
89.9% ±2.1Log ↗
38GLM 5.1 Open source
Z.ai
89.9% ±2.1Log ↗
39GPT-5.4
OpenAI
89.9% ±2.1Log ↗
40Muse Spark
Meta AI
89.8% ±2.2Source ↗
41Gemini 3 Flash Preview
Google
89.4% ±2.2Log ↗
42Grok 4.20
SpaceXAI
89.3% ±1.9Source ↗
43GPT-5.4 (medium)
OpenAI
88.9% ±2.2Log ↗
44Grok 4.3 Beta
xAI
88.8% ±2.0Source ↗
45Claude Opus 4.6 (64k thinking)
Anthropic
88.8% ±1.9Log ↗
46Inkling Small (xhigh) Open source
Thinking Machines
88.5% ±1.9Source ↗
47Qwen 3.6 Plus (2026-04-02)
Alibaba
88.4% ±2.3Log ↗
48Claude Opus 4.6
Anthropic
88.4% ±2.3Log ↗
49Inkling (xhigh) Open source
Thinking Machines
88.3% ±1.9Source ↗
50GPT-5.2
OpenAI
88.2% ±1.9Log ↗
51Claude Opus 5 (low)
Anthropic
87.9% ±2.3Log ↗
52Kimi K2.7 Code Open source
MoonshotAI
87.9% ±2.3Log ↗
53Qwen3.7 Plus
Qwen
87.9% ±2.3Log ↗
54GPT-5.2 (medium)
OpenAI
87.9% ±1.9Log ↗
55GLM 5 Open source
Z.ai
87.8% ±2.3Log ↗
56GPT-5.1
OpenAI
87.6% ±1.9Log ↗
57Kimi K2.5 (Fireworks) Open source
Moonshot
87.6% ±1.9Log ↗
58GPT-5.6 Terra (low)
OpenAI
87.4% ±2.4Log ↗
59Qwen 3.6 Max (Preview)
Alibaba
87.4% ±2.4Log ↗
60Claude Sonnet 4.6 (32k thinking)
Anthropic
87.4% ±2.0Log ↗
61Grok 4
xAI
87.0% ±2.0Source ↗
62GPT-5.4 mini (xhigh)
OpenAI
86.9% ±2.4Log ↗
63Claude Opus 4.7
Anthropic
86.4% ±2.4Log ↗
64Qwen3.5 397B A17B Open source
Qwen
86.4% ±2.4Log ↗
65GPT-5
OpenAI
86.2% ±2.1Log ↗
66Claude Opus 4.5 (32k thinking)
Anthropic
86.0% ±2.1Log ↗
67Claude Fable 5
Anthropic
85.9% ±2.5Log ↗
68Qwen3.6 27B Open source
Qwen
85.9% ±2.5Log ↗
69Claude Opus 4.5 (16k thinking)
Anthropic
85.5% ±2.2Log ↗
70Nemotron 3 Ultra Open source
NVIDIA
85.4% ±2.5Log ↗
71GPT-5 (medium)
OpenAI
85.4% ±2.1Log ↗
72Gemini 2.5 Pro (Jun 2025)
Google DeepMind
85.3% ±2.1Log ↗
73GPT-5.1 (medium)
OpenAI
85.0% ±2.1Log ↗
74Kimi K3 (low) Open source
Moonshot
84.8% ±2.6Log ↗
75Qwen3.6 35B A3B Open source
Qwen
84.8% ±2.6Log ↗
76GPT-5.4 (low)
OpenAI
84.8% ±2.6Log ↗
77Qwen3.5 Plus 2026-02-15
Qwen
84.8% ±2.6Log ↗
78Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
84.8% ±2.6Log ↗
79Kimi K2 Thinking Turbo Open source
Moonshot
84.2% ±2.1Log ↗
80Gemini 2.5 Pro Exp (Mar 2025)
Google DeepMind
83.8% ±2.6Log ↗
81GPT-5.4 Mini
OpenAI
83.6% ±2.2Log ↗
82Qwen3.5-35B-A3B Open source
Qwen
83.5% ±2.2Log ↗
83DeepSeek V3.2 Open source
DeepSeek
83.4% ±2.0Log ↗
84Gemini 3.5 Flash Lite
Google
83.3% ±2.7Log ↗
85Qwen 3.6 Flash (2026-04-16)
Alibaba
83.3% ±2.7Log ↗
86Claude Sonnet 4.6
Anthropic
83.3% ±2.7Log ↗
87Claude Sonnet 4.6 (medium)
Anthropic
83.3% ±2.7Log ↗
88GLM 4.7 Open source
Z.ai
83.3% ±2.4Log ↗
89GPT-5.6 Sol (none)
OpenAI
82.8% ±2.7Log ↗
90GPT-5.2 (low)
OpenAI
82.7% ±2.3Log ↗
91GPT-5.5 Instant
OpenAI
82.5% ±2.3Source ↗
92Qwen3.7 Flash
Qwen
82.3% ±2.7Log ↗
93GPT-5.6 Luna (low)
OpenAI
82.3% ±2.7Log ↗
94Qwen3.5-Flash
Qwen
82.3% ±2.7Log ↗
95Claude Sonnet 4.5 (59k thinking)
Anthropic
82.3% ±2.7Log ↗
96Gemini 3.1 Flash Lite
Google
81.8% ±2.7Log ↗
97o3
OpenAI
81.8% ±2.1Log ↗
98Claude Sonnet 4.5 (32k thinking)
Anthropic
81.7% ±2.8Log ↗
99o3 (medium)
OpenAI
80.8% ±2.8Log ↗
100Claude Opus 4.5 (no thinking)
Anthropic
80.7% ±2.4Log ↗
101Claude Sonnet 5
Anthropic
80.3% ±2.8Log ↗
102Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
80.1% ±2.6Log ↗
103o3 (low)
OpenAI
79.8% ±2.9Log ↗
104Claude 3.7 Sonnet (64k thinking)
Anthropic
79.7% ±2.7Log ↗
105o4 Mini
OpenAI
79.6% ±2.4Log ↗
106Claude Sonnet 4
Anthropic
79.2% ±2.7Log ↗
107Qwen3.5-9B Open source
Qwen
79.0% ±2.4Log ↗
108Claude Fable 5 (low)
Anthropic
78.8% ±2.9Log ↗
109Claude Sonnet 4.5 (16k thinking)
Anthropic
78.8% ±2.9Log ↗
110GPT-5.4 Nano
OpenAI
78.5% ±2.4Log ↗
111o4-mini (medium)
OpenAI
77.8% ±3.0Log ↗
112GPT-5.6 Terra (none)
OpenAI
77.3% ±3.0Log ↗
113GPT-5.5 (no thinking)
OpenAI
77.3% ±3.0Log ↗
114Claude Opus 4.1
Anthropic
77.3% ±3.0Log ↗
115o3 Mini
OpenAI
77.0% ±2.6Log ↗
116Claude 3.7 Sonnet (32k thinking)
Anthropic
76.8% ±3.0Log ↗
117Claude 3.7 Sonnet (16k thinking)
Anthropic
76.8% ±3.0Log ↗
118o1
OpenAI
76.8% ±3.0Log ↗
119DeepSeek-R1 (May 2025) Open source
DeepSeek
76.3% ±2.4Log ↗
120Grok-3 mini
xAI
76.3% ±3.0Log ↗
121Claude Opus 4
Anthropic
76.3% ±3.0Log ↗
122Gemma 4 31B Open source
Google
75.8% ±3.1Log ↗
123gpt-oss-120b Open source
OpenAI
75.8% ±2.7Log ↗
124Grok 3
xAI
75.8% ±2.7Log ↗
125o1 (medium)
OpenAI
75.8% ±3.1Log ↗
126o4-mini (low)
OpenAI
75.3% ±3.1Log ↗
127GPT-5 Mini
OpenAI
75.0% ±2.3Log ↗
128GPT-5.4 (none)
OpenAI
74.7% ±3.1Log ↗
129o3-mini (medium)
OpenAI
74.3% ±2.5Log ↗
130o1 (low)
OpenAI
74.2% ±3.1Log ↗
131Claude Sonnet 4.5 (no thinking)
Anthropic
73.7% ±3.1Log ↗
132DeepSeek v4 Pro (unknown thinking) Open source
DeepSeek
73.2% ±3.2Log ↗
133Gemma 4 26B A4B Open source
Google
73.2% ±3.2Log ↗
134GPT-5.2 (none)
OpenAI
73.2% ±3.2Log ↗
135Qwen3-Max-Instruct
Alibaba
72.6% ±2.7Log ↗
136GPT-5.4 nano (low)
OpenAI
72.2% ±3.2Log ↗
137GPT-5 mini (minimal)
OpenAI
71.7% ±3.2Log ↗
138GPT-5 (minimal)
OpenAI
71.7% ±3.2Log ↗
139R1 Open source
DeepSeek
71.7% ±3.1Log ↗
140GPT-5 mini (medium)
OpenAI
71.7% ±2.3Log ↗
141seed-oss-36b-instruct
71.5% ±2.7Log ↗
142Claude Haiku 4.5
Anthropic
71.2% ±3.2Log ↗
143Qwen3 235B A22B Open source
Qwen
70.7% ±2.7Log ↗
144Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
70.1% ±2.8Log ↗
145GPT-5 Nano
OpenAI
69.4% ±2.8Log ↗
146GPT-4.5 Preview (Feb 2025)
OpenAI
68.7% ±3.3Log ↗
147DeepSeek-V3 (Mar 2025) Open source
DeepSeek
67.6% ±2.7Log ↗
148GPT-5 nano (medium)
OpenAI
67.4% ±2.7Log ↗
149Llama 4 Maverick (FP8) Open source
Meta AI
67.0% ±2.8Log ↗
150GPT-4.1
OpenAI
66.9% ±2.8Log ↗
151GPT-5.1 (no thinking)
OpenAI
66.7% ±3.4Log ↗
152Claude 3.7 Sonnet
Anthropic
66.0% ±2.7Log ↗
153GPT-4.1 Mini
OpenAI
65.8% ±2.7Log ↗
154Qwen3 32B Open source
Qwen
65.7% ±2.8Log ↗
155Gemini 2.0 Pro Exp (Feb 2025)
Google DeepMind
65.7% ±3.4Log ↗
156QWQ-Plus
Alibaba
65.4% ±2.8Log ↗
157QwQ-32B Open source
Alibaba
65.3% ±2.8Log ↗
158GPT-5.4 mini (none)
OpenAI
64.1% ±3.4Log ↗
159Gemini 2.0 Flash (Feb 2025)
Google DeepMind,Google
64.1% ±2.7Log ↗
160DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
64.1% ±2.8Log ↗
161Qwen3 14B Open source
Qwen
63.8% ±2.9Log ↗
162GPT-5.6 Luna (none)
OpenAI
63.6% ±3.4Log ↗
163o1-mini
OpenAI
62.4% ±2.7Log ↗
164Qwen3 30B A3B Open source
Qwen
61.7% ±3.0Log ↗
165gpt-oss-20b Open source
OpenAI
60.8% ±2.5Log ↗
166GLM 4.7 Flash Open source
Z.ai
60.5% ±2.9Log ↗
167Mistral Medium 3
Mistral
59.5% ±2.8Log ↗
168o1-mini (medium)
OpenAI
59.5% ±2.8Log ↗
169GPT-5 nano (low)
OpenAI
57.6% ±3.5Log ↗
170Gemini 1.5 Pro (Sept 2024)
Google DeepMind
57.2% ±2.8Log ↗
171Gemini 2.0 Flash Thinking Exp
Google DeepMind,Google
57.1% ±3.5Log ↗
172Qwen3 8B Open source
Qwen
56.8% ±2.9Log ↗
173DeepSeek V3 Open source
DeepSeek
56.5% ±2.8Log ↗
174Qwen2.5-Max
Alibaba
56.1% ±2.8Log ↗
175Magistral Small 1.0 Open source
Mistral AI
56.1% ±3.5Log ↗
176Phi 4 Open source
Microsoft
56.1% ±2.6Log ↗
177DeepSeek-R1-Distill-Llama-70B Open source
DeepSeek
55.7% ±3.0Log ↗
178Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
55.6% ±2.9Log ↗
179GPT-5.4 nano (no thinking)
OpenAI
55.6% ±3.5Log ↗
180Claude 3.5 Sonnet (Oct 2024)
Anthropic
55.3% ±2.8Log ↗
181Claude 3.5 Sonnet (Jun 2024)
Anthropic
54.0% ±2.8Log ↗
182Grok-2 (Dec 2024)
xAI
53.8% ±2.7Log ↗
183Qwen3-4B Open source
Alibaba
52.3% ±3.0Log ↗
184Llama 4 Scout Open source
Meta
51.8% ±3.2Log ↗
185Mistral Large 2 (Nov 2024) Open source
Mistral AI
51.3% ±2.7Log ↗
186Llama 3.1-405B Open source
Meta AI
50.9% ±2.6Log ↗
187o1-preview
OpenAI
50.3% ±2.8Log ↗
188GPT-4o (Aug 2024)
OpenAI
49.2% ±2.6Log ↗
189Qwen2.5-72B Open source
Alibaba
49.1% ±2.7Log ↗
190Mistral Small 3.2 Open source
Mistral AI
49.1% ±2.8Log ↗
191Mistral Large 2 (Jul 2024) Open source
Mistral AI
49.0% ±2.6Log ↗
192GPT-4.1 Nano
OpenAI
48.9% ±2.5Log ↗
193GPT-4o (May 2024)
OpenAI
48.9% ±2.6Log ↗
194GPT-5 nano (minimal)
OpenAI
48.5% ±3.6Log ↗
195Qwen Plus (Jan 2025)
Alibaba
48.1% ±2.7Log ↗
196GPT-4o (Nov 2024)
OpenAI
47.9% ±2.6Log ↗
197Gemma 3 27B Open source
Google
47.7% ±2.7Log ↗
198Magistral Small 1.2 Open source
Mistral AI
47.6% ±2.6Log ↗
199Mistral Small 3.1 Open source
Mistral AI
47.5% ±2.8Log ↗
200Llama 3.3 70B Open source
Meta AI
47.4% ±2.9Log ↗
201Gemini 1.5 Flash (Sep 2024)
Google DeepMind
47.3% ±2.8Log ↗
202Mistral Small 3 Open source
Mistral
47.3% ±2.8Log ↗
203Claude 3 Opus
Anthropic
47.2% ±2.6Log ↗
204GPT-4 Turbo (Apr 2024)
OpenAI
46.6% ±2.7Log ↗
205Tulu 3 (Tülu 3) 70B Open source
Allen Institute for AI,University of Washington
46.3% ±2.4Log ↗
206Qwen2.5-32B Open source
Alibaba
46.1% ±2.6Log ↗
207Gemini 1.5 Pro (May 2024)
Google DeepMind
45.9% ±2.6Log ↗
208qwen3-4b-instruct-2507
45.8% ±2.9Log ↗
209DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
44.7% ±2.9Log ↗
210Llama 3.1-70B Open source
Meta AI
44.2% ±2.5Log ↗
211WizardLM-2 8x22B Open source
microsoft
43.4% ±2.3Log ↗
212GPT-4 Turbo Preview (Nov 2023)
OpenAI
42.4% ±2.4Log ↗
213GPT-4 Turbo Preview (January 2024)
OpenAI
42.3% ±2.7Log ↗
214Qwen-Turbo
Alibaba
41.8% ±2.6Log ↗
215Llama 3.2 90B Open source
Meta AI
41.0% ±2.3Log ↗
216Qwen2-72B Open source
Alibaba
40.8% ±2.6Log ↗
217Claude 3 Sonnet
Anthropic
40.6% ±2.4Log ↗
218Llama 3-70B Open source
Meta AI
40.6% ±2.6Log ↗
219Gemini 1.5 Flash (May 2024)
Google DeepMind
40.4% ±2.4Log ↗
220Gemma 3 12B Open source
Google
39.5% ±2.5Log ↗
221Mistral Large
mistralai
38.8% ±2.5Log ↗
222Claude 3.5 Haiku (Oct 2024)
Anthropic
38.1% ±2.6Log ↗
223Qwen3-1.7B Open source
Alibaba
38.0% ±2.7Log ↗
224GPT-4o-mini
OpenAI
37.7% ±2.4Log ↗
225Hermes 2 Theta Llama-3 70B Open source
Nous Research,Arcee AI
37.5% ±2.5Log ↗
226Gemma 2 27B Open source
Google
36.5% ±2.4Log ↗
227Claude 3 Haiku
Anthropic
36.3% ±2.4Log ↗
228GPT-4 (Mar 2023)
OpenAI
35.7% ±2.4Log ↗
229Qwen2.5-7B Open source
Alibaba
35.5% ±2.3Log ↗
230Claude 2
Anthropic
34.7% ±2.5Log ↗
231Mixtral 8x22B Open source
Mistral AI
34.1% ±2.1Log ↗
232Gemini 1.0 Pro
Google DeepMind
34.0% ±2.0Log ↗
233Eurus-2-7B-PRIME Open source
Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute
33.9% ±2.1Log ↗
234DeepSeek-R1-Distill-Qwen-1.5B Open source
DeepSeek
33.6% ±2.1Log ↗
235Gemini 1.5 Flash 8B
Google DeepMind
33.0% ±2.4Log ↗
236Claude 2.1
Anthropic
33.0% ±2.3Log ↗
237DBRX Open source
Databricks
32.9% ±3.3Log ↗
238Yi-1.5-34B Open source
01.AI
32.0% ±2.0Log ↗
239Qwen1.5-32B Open source
Alibaba
30.7% ±2.0Log ↗
240GPT-4 (Jun 2023)
OpenAI
30.7% ±2.3Log ↗
241Mixtral 8x7B Open source
Mistral AI
30.6% ±1.9Log ↗
242Mistral Nemo Open source
Mistral
29.9% ±2.1Log ↗
243Qwen1.5-72B Open source
Alibaba
28.8% ±2.0Log ↗
244Granite 4.0 Micro Open source
IBM
28.3% ±1.8Log ↗
245GPT-3.5 Turbo (Nov 2023)
OpenAI
28.0% ±1.9Log ↗
246phi-3-medium 14B Open source
Microsoft
27.6% ±1.6Log ↗
247Gemma 2 9B Open source
Google DeepMind
27.5% ±2.3Log ↗
248GPT-3.5 Turbo (Jan 2024)
OpenAI
27.2% ±2.0Log ↗
249Ministral 8B Open source
Mistral AI
27.1% ±2.1Log ↗
250Llama 3.1-8B Open source
Meta AI
27.0% ±1.9Log ↗
251Llama 2-70B Open source
Meta AI
26.3% ±2.0Log ↗
252Llama 3-8B Open source
Meta AI
26.1% ±1.7Log ↗
253Ministral 3B
Mistral AI
25.3% ±1.9Log ↗
254DeepSeek LLM 67B Open source
DeepSeek
24.6% ±1.4Log ↗
255granite-4.0-1b
24.0% ±1.6Log ↗
256Llama 3.2 1B Open source
Meta AI
23.9% ±1.6Log ↗
257Gemma 3 4B Open source
Google
23.2% ±1.9Log ↗
258Gemma 3 1B Open source
Google DeepMind
19.9% ±1.5Log ↗
259Mistral 7B v0.3 Open source
Mistral AI
15.2% ±1.0Log ↗
260Yi-34B Open source
01.AI
14.7% ±1.1Log ↗
261granite-4.0-350m
11.2% ±0.9Log ↗
262deepseek-r1-0528-qwen3-8b
9.3% ±1.1Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.