Skip to content
science benchmark · included in ECI

GPQA diamond

198 graduate-level, 'Google-proof' multiple-choice questions in biology, physics and chemistry.
Results
96
Random baseline
25.0%
Score ceiling
100%
Released
20 Nov 2023

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 Open source
MoonshotAI
93.1% ±1.5Source ↗
2GLM 5.2 Open source
Z.ai
91.9% ±1.6Source ↗
3DeepSeek V4 Pro 0813 Open source
DeepSeek
91.7% ±1.5Source ↗
4DeepSeek V4 Flash 0731 Open source
DeepSeek
91.0% ±1.8Source ↗
5GLM 5.3 Open source
Z.ai
90.9% ±1.6Source ↗
6MiniMax M3 Open source
MiniMax
90.9% ±2.0Log ↗
7DeepSeek v4 Pro (high) Open source
DeepSeek
90.9% ±2.0Log ↗
8Kimi K2.6 Open source
MoonshotAI
90.8% ±1.7Log ↗
9GLM 5.3 Flash Open source
Z.ai
90.2% ±1.7Source ↗
10GLM 5.1 Open source
Z.ai
89.9% ±2.1Log ↗
11Inkling Small (xhigh) Open source
Thinking Machines
88.5% ±1.9Source ↗
12Inkling (xhigh) Open source
Thinking Machines
88.3% ±1.9Source ↗
13Kimi K2.7 Code Open source
MoonshotAI
87.9% ±2.3Log ↗
14GLM 5 Open source
Z.ai
87.8% ±2.3Log ↗
15Kimi K2.5 (Fireworks) Open source
Moonshot
87.6% ±1.9Log ↗
16Qwen3.5 397B A17B Open source
Qwen
86.4% ±2.4Log ↗
17Qwen3.6 27B Open source
Qwen
85.9% ±2.5Log ↗
18Nemotron 3 Ultra Open source
NVIDIA
85.4% ±2.5Log ↗
19Kimi K3 (low) Open source
Moonshot
84.8% ±2.6Log ↗
20Qwen3.6 35B A3B Open source
Qwen
84.8% ±2.6Log ↗
21Kimi K2 Thinking Turbo Open source
Moonshot
84.2% ±2.1Log ↗
22Qwen3.5-35B-A3B Open source
Qwen
83.5% ±2.2Log ↗
23DeepSeek V3.2 Open source
DeepSeek
83.4% ±2.0Log ↗
24GLM 4.7 Open source
Z.ai
83.3% ±2.4Log ↗
25Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
80.1% ±2.6Log ↗
26Qwen3.5-9B Open source
Qwen
79.0% ±2.4Log ↗
27DeepSeek-R1 (May 2025) Open source
DeepSeek
76.3% ±2.4Log ↗
28Gemma 4 31B Open source
Google
75.8% ±3.1Log ↗
29gpt-oss-120b Open source
OpenAI
75.8% ±2.7Log ↗
30DeepSeek v4 Pro (unknown thinking) Open source
DeepSeek
73.2% ±3.2Log ↗
31Gemma 4 26B A4B Open source
Google
73.2% ±3.2Log ↗
32R1 Open source
DeepSeek
71.7% ±3.1Log ↗
33Qwen3 235B A22B Open source
Qwen
70.7% ±2.7Log ↗
34Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
70.1% ±2.8Log ↗
35DeepSeek-V3 (Mar 2025) Open source
DeepSeek
67.6% ±2.7Log ↗
36Llama 4 Maverick (FP8) Open source
Meta AI
67.0% ±2.8Log ↗
37Qwen3 32B Open source
Qwen
65.7% ±2.8Log ↗
38QwQ-32B Open source
Alibaba
65.3% ±2.8Log ↗
39DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
64.1% ±2.8Log ↗
40Qwen3 14B Open source
Qwen
63.8% ±2.9Log ↗
41Qwen3 30B A3B Open source
Qwen
61.7% ±3.0Log ↗
42gpt-oss-20b Open source
OpenAI
60.8% ±2.5Log ↗
43GLM 4.7 Flash Open source
Z.ai
60.5% ±2.9Log ↗
44Qwen3 8B Open source
Qwen
56.8% ±2.9Log ↗
45DeepSeek V3 Open source
DeepSeek
56.5% ±2.8Log ↗
46Magistral Small 1.0 Open source
Mistral AI
56.1% ±3.5Log ↗
47Phi 4 Open source
Microsoft
56.1% ±2.6Log ↗
48DeepSeek-R1-Distill-Llama-70B Open source
DeepSeek
55.7% ±3.0Log ↗
49Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
55.6% ±2.9Log ↗
50Qwen3-4B Open source
Alibaba
52.3% ±3.0Log ↗
51Llama 4 Scout Open source
Meta
51.8% ±3.2Log ↗
52Mistral Large 2 (Nov 2024) Open source
Mistral AI
51.3% ±2.7Log ↗
53Llama 3.1-405B Open source
Meta AI
50.9% ±2.6Log ↗
54Qwen2.5-72B Open source
Alibaba
49.1% ±2.7Log ↗
55Mistral Small 3.2 Open source
Mistral AI
49.1% ±2.8Log ↗
56Mistral Large 2 (Jul 2024) Open source
Mistral AI
49.0% ±2.6Log ↗
57Gemma 3 27B Open source
Google
47.7% ±2.7Log ↗
58Magistral Small 1.2 Open source
Mistral AI
47.6% ±2.6Log ↗
59Mistral Small 3.1 Open source
Mistral AI
47.5% ±2.8Log ↗
60Llama 3.3 70B Open source
Meta AI
47.4% ±2.9Log ↗
61Mistral Small 3 Open source
Mistral
47.3% ±2.8Log ↗
62Tulu 3 (Tülu 3) 70B Open source
Allen Institute for AI,University of Washington
46.3% ±2.4Log ↗
63Qwen2.5-32B Open source
Alibaba
46.1% ±2.6Log ↗
64DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
44.7% ±2.9Log ↗
65Llama 3.1-70B Open source
Meta AI
44.2% ±2.5Log ↗
66WizardLM-2 8x22B Open source
microsoft
43.4% ±2.3Log ↗
67Llama 3.2 90B Open source
Meta AI
41.0% ±2.3Log ↗
68Qwen2-72B Open source
Alibaba
40.8% ±2.6Log ↗
69Llama 3-70B Open source
Meta AI
40.6% ±2.6Log ↗
70Gemma 3 12B Open source
Google
39.5% ±2.5Log ↗
71Qwen3-1.7B Open source
Alibaba
38.0% ±2.7Log ↗
72Hermes 2 Theta Llama-3 70B Open source
Nous Research,Arcee AI
37.5% ±2.5Log ↗
73Gemma 2 27B Open source
Google
36.5% ±2.4Log ↗
74Qwen2.5-7B Open source
Alibaba
35.5% ±2.3Log ↗
75Mixtral 8x22B Open source
Mistral AI
34.1% ±2.1Log ↗
76Eurus-2-7B-PRIME Open source
Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute
33.9% ±2.1Log ↗
77DeepSeek-R1-Distill-Qwen-1.5B Open source
DeepSeek
33.6% ±2.1Log ↗
78DBRX Open source
Databricks
32.9% ±3.3Log ↗
79Yi-1.5-34B Open source
01.AI
32.0% ±2.0Log ↗
80Qwen1.5-32B Open source
Alibaba
30.7% ±2.0Log ↗
81Mixtral 8x7B Open source
Mistral AI
30.6% ±1.9Log ↗
82Mistral Nemo Open source
Mistral
29.9% ±2.1Log ↗
83Qwen1.5-72B Open source
Alibaba
28.8% ±2.0Log ↗
84Granite 4.0 Micro Open source
IBM
28.3% ±1.8Log ↗
85phi-3-medium 14B Open source
Microsoft
27.6% ±1.6Log ↗
86Gemma 2 9B Open source
Google DeepMind
27.5% ±2.3Log ↗
87Ministral 8B Open source
Mistral AI
27.1% ±2.1Log ↗
88Llama 3.1-8B Open source
Meta AI
27.0% ±1.9Log ↗
89Llama 2-70B Open source
Meta AI
26.3% ±2.0Log ↗
90Llama 3-8B Open source
Meta AI
26.1% ±1.7Log ↗
91DeepSeek LLM 67B Open source
DeepSeek
24.6% ±1.4Log ↗
92Llama 3.2 1B Open source
Meta AI
23.9% ±1.6Log ↗
93Gemma 3 4B Open source
Google
23.2% ±1.9Log ↗
94Gemma 3 1B Open source
Google DeepMind
19.9% ±1.5Log ↗
95Mistral 7B v0.3 Open source
Mistral AI
15.2% ±1.0Log ↗
96Yi-34B Open source
01.AI
14.7% ±1.1Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.