science benchmark · included in ECI
GPQA diamond
198 graduate-level, 'Google-proof' multiple-choice questions in biology, physics and chemistry.
Results
96
Random baseline
25.0%
Score ceiling
100%
Released
20 Nov 2023
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Kimi K3 Open source MoonshotAI | 93.1% ±1.5 | max | 16 Jul 2026 | 16 Jul 2026 | Source ↗ | |
| 2 | GLM 5.2 Open source Z.ai | 91.9% ±1.6 | max | 16 Jun 2026 | 24 Jun 2026 | Source ↗ | |
| 3 | DeepSeek V4 Pro 0813 Open source DeepSeek | 91.7% ±1.5 | max | 13 Aug 2026 | 18 Aug 2026 | Source ↗ | |
| 4 | DeepSeek V4 Flash 0731 Open source DeepSeek | 91.0% ±1.8 | max | 31 Jul 2026 | 2 Aug 2026 | Source ↗ | |
| 5 | GLM 5.3 Open source Z.ai | 90.9% ±1.6 | max | 14 Aug 2026 | 24 Aug 2026 | Source ↗ | |
| 6 | MiniMax M3 Open source MiniMax | 90.9% ±2.0 | — | 1 Jun 2026 | 10 Aug 2026 | Log ↗ | |
| 7 | DeepSeek v4 Pro (high) Open source DeepSeek | 90.9% ±2.0 | high | 24 Apr 2026 | 6 Aug 2026 | Log ↗ | |
| 8 | Kimi K2.6 Open source MoonshotAI | 90.8% ±1.7 | — | 20 Apr 2026 | 1 May 2026 | Log ↗ | |
| 9 | GLM 5.3 Flash Open source Z.ai | 90.2% ±1.7 | max | 20 Aug 2026 | 26 Aug 2026 | Source ↗ | |
| 10 | GLM 5.1 Open source Z.ai | 89.9% ±2.1 | — | 7 Apr 2026 | 10 Aug 2026 | Log ↗ | |
| 11 | Inkling Small (xhigh) Open source Thinking Machines | 88.5% ±1.9 | xhigh | 15 Jul 2026 | 14 Aug 2026 | Source ↗ | |
| 12 | Inkling (xhigh) Open source Thinking Machines | 88.3% ±1.9 | xhigh | 15 Jul 2026 | 5 Aug 2026 | Source ↗ | |
| 13 | Kimi K2.7 Code Open source MoonshotAI | 87.9% ±2.3 | — | 12 Jun 2026 | 7 Aug 2026 | Log ↗ | |
| 14 | GLM 5 Open source Z.ai | 87.8% ±2.3 | — | 11 Feb 2026 | 12 Feb 2026 | Log ↗ | |
| 15 | Kimi K2.5 (Fireworks) Open source Moonshot | 87.6% ±1.9 | — | 27 Jan 2026 | 2 Feb 2026 | Log ↗ | |
| 16 | Qwen3.5 397B A17B Open source Qwen | 86.4% ±2.4 | none | 13 Feb 2026 | 7 Aug 2026 | Log ↗ | |
| 17 | Qwen3.6 27B Open source Qwen | 85.9% ±2.5 | — | 22 Apr 2026 | 7 Aug 2026 | Log ↗ | |
| 18 | Nemotron 3 Ultra Open source NVIDIA | 85.4% ±2.5 | — | 4 Jun 2026 | 10 Aug 2026 | Log ↗ | |
| 19 | Kimi K3 (low) Open source Moonshot | 84.8% ±2.6 | low | 16 Jul 2026 | 7 Aug 2026 | Log ↗ | |
| 20 | Qwen3.6 35B A3B Open source Qwen | 84.8% ±2.6 | none | 27 Apr 2026 | 7 Aug 2026 | Log ↗ | |
| 21 | Kimi K2 Thinking Turbo Open source Moonshot | 84.2% ±2.1 | — | 6 Nov 2025 | 11 Nov 2025 | Log ↗ | |
| 22 | Qwen3.5-35B-A3B Open source Qwen | 83.5% ±2.2 | — | 24 Feb 2026 | 28 Aug 2026 | Log ↗ | |
| 23 | DeepSeek V3.2 Open source DeepSeek | 83.4% ±2.0 | — | 1 Dec 2025 | 16 Dec 2025 | Log ↗ | |
| 24 | GLM 4.7 Open source Z.ai | 83.3% ±2.4 | — | 22 Dec 2025 | 29 Jan 2026 | Log ↗ | |
| 25 | Qwen3-235B-A22B-Thinking (Jul 2025) Open source Alibaba | 80.1% ±2.6 | — | 25 Jul 2025 | 11 Dec 2025 | Log ↗ | |
| 26 | Qwen3.5-9B Open source Qwen | 79.0% ±2.4 | — | 24 Feb 2026 | 27 Aug 2026 | Log ↗ | |
| 27 | DeepSeek-R1 (May 2025) Open source DeepSeek | 76.3% ±2.4 | — | 28 May 2025 | 29 May 2025 | Log ↗ | |
| 28 | Gemma 4 31B Open source Google | 75.8% ±3.1 | minimal | 2 Apr 2026 | 6 Aug 2026 | Log ↗ | |
| 29 | gpt-oss-120b Open source OpenAI | 75.8% ±2.7 | high | 5 Aug 2025 | 11 Dec 2025 | Log ↗ | |
| 30 | DeepSeek v4 Pro (unknown thinking) Open source DeepSeek | 73.2% ±3.2 | none | 24 Apr 2026 | 6 Aug 2026 | Log ↗ | |
| 31 | Gemma 4 26B A4B Open source Google | 73.2% ±3.2 | minimal | 2 Apr 2026 | 6 Aug 2026 | Log ↗ | |
| 32 | R1 Open source DeepSeek | 71.7% ±3.1 | — | 20 Jan 2025 | 26 May 2025 | Log ↗ | |
| 33 | Qwen3 235B A22B Open source Qwen | 70.7% ±2.7 | — | 28 Apr 2025 | 3 Jun 2025 | Log ↗ | |
| 34 | Qwen3-30B-A3B-Thinking (Jul 2025) Open source Alibaba | 70.1% ±2.8 | — | 30 Jul 2025 | 30 Aug 2026 | Log ↗ | |
| 35 | DeepSeek-V3 (Mar 2025) Open source DeepSeek | 67.6% ±2.7 | — | 24 Mar 2025 | 1 Apr 2025 | Log ↗ | |
| 36 | Llama 4 Maverick (FP8) Open source Meta AI | 67.0% ±2.8 | — | 5 Apr 2025 | 8 Apr 2025 | Log ↗ | |
| 37 | Qwen3 32B Open source Qwen | 65.7% ±2.8 | — | 29 Apr 2025 | 28 Aug 2026 | Log ↗ | |
| 38 | QwQ-32B Open source Alibaba | 65.3% ±2.8 | — | 5 Mar 2025 | 28 Aug 2026 | Log ↗ | |
| 39 | DeepSeek-R1-Distill-Qwen-32B Open source DeepSeek | 64.1% ±2.8 | — | 20 Jan 2025 | 28 Aug 2026 | Log ↗ | |
| 40 | Qwen3 14B Open source Qwen | 63.8% ±2.9 | — | 29 Apr 2025 | 28 Aug 2026 | Log ↗ | |
| 41 | Qwen3 30B A3B Open source Qwen | 61.7% ±3.0 | — | 29 Apr 2025 | 30 Aug 2026 | Log ↗ | |
| 42 | gpt-oss-20b Open source OpenAI | 60.8% ±2.5 | medium | 5 Aug 2025 | 27 Aug 2026 | Log ↗ | |
| 43 | GLM 4.7 Flash Open source Z.ai | 60.5% ±2.9 | — | 19 Jan 2026 | 30 Aug 2026 | Log ↗ | |
| 44 | Qwen3 8B Open source Qwen | 56.8% ±2.9 | — | 28 Apr 2025 | 27 Aug 2026 | Log ↗ | |
| 45 | DeepSeek V3 Open source DeepSeek | 56.5% ±2.8 | — | 26 Dec 2024 | 27 Jan 2025 | Log ↗ | |
| 46 | Magistral Small 1.0 Open source Mistral AI | 56.1% ±3.5 | — | 10 Jun 2025 | 6 Aug 2026 | Log ↗ | |
| 47 | Phi 4 Open source Microsoft | 56.1% ±2.6 | — | 12 Dec 2024 | 31 Jan 2025 | Log ↗ | |
| 48 | DeepSeek-R1-Distill-Llama-70B Open source DeepSeek | 55.7% ±3.0 | — | 20 Jan 2025 | 10 Mar 2025 | Log ↗ | |
| 49 | Qwen3-30B-A3B-Instruct (Jul 2025) Open source Alibaba | 55.6% ±2.9 | — | 29 Jul 2025 | 30 Aug 2026 | Log ↗ | |
| 50 | Qwen3-4B Open source Alibaba | 52.3% ±3.0 | — | 29 Apr 2025 | 28 Aug 2026 | Log ↗ | |
| 51 | Llama 4 Scout Open source Meta | 51.8% ±3.2 | — | 5 Apr 2025 | 8 Apr 2025 | Log ↗ | |
| 52 | Mistral Large 2 (Nov 2024) Open source Mistral AI | 51.3% ±2.7 | — | 18 Nov 2024 | 25 Feb 2025 | Log ↗ | |
| 53 | Llama 3.1-405B Open source Meta AI | 50.9% ±2.6 | — | 23 Jul 2024 | 27 Jan 2025 | Log ↗ | |
| 54 | Qwen2.5-72B Open source Alibaba | 49.1% ±2.7 | — | 19 Sep 2024 | 27 Jan 2025 | Log ↗ | |
| 55 | Mistral Small 3.2 Open source Mistral AI | 49.1% ±2.8 | — | 20 Jun 2025 | 28 Aug 2026 | Log ↗ | |
| 56 | Mistral Large 2 (Jul 2024) Open source Mistral AI | 49.0% ±2.6 | — | 24 Jul 2024 | 27 Jan 2025 | Log ↗ | |
| 57 | Gemma 3 27B Open source Google | 47.7% ±2.7 | — | 12 Mar 2025 | 27 Aug 2026 | Log ↗ | |
| 58 | Magistral Small 1.2 Open source Mistral AI | 47.6% ±2.6 | — | 18 Sep 2025 | 30 Aug 2026 | Log ↗ | |
| 59 | Mistral Small 3.1 Open source Mistral AI | 47.5% ±2.8 | — | 17 Mar 2025 | 18 Mar 2025 | Log ↗ | |
| 60 | Llama 3.3 70B Open source Meta AI | 47.4% ±2.9 | — | 6 Dec 2024 | 27 Jan 2025 | Log ↗ | |
| 61 | Mistral Small 3 Open source Mistral | 47.3% ±2.8 | — | 30 Jan 2025 | 30 Aug 2026 | Log ↗ | |
| 62 | Tulu 3 (Tülu 3) 70B Open source Allen Institute for AI,University of Washington | 46.3% ±2.4 | — | 21 Nov 2024 | 27 Jan 2025 | Log ↗ | |
| 63 | Qwen2.5-32B Open source Alibaba | 46.1% ±2.6 | — | 17 Sep 2024 | 30 Jan 2025 | Log ↗ | |
| 64 | DeepSeek-R1-Distill-Qwen-14B Open source DeepSeek | 44.7% ±2.9 | — | 20 Jan 2025 | 10 Mar 2025 | Log ↗ | |
| 65 | Llama 3.1-70B Open source Meta AI | 44.2% ±2.5 | — | 23 Jul 2024 | 27 Jan 2025 | Log ↗ | |
| 66 | WizardLM-2 8x22B Open source microsoft | 43.4% ±2.3 | — | 16 Apr 2024 | 27 Jan 2025 | Log ↗ | |
| 67 | Llama 3.2 90B Open source Meta AI | 41.0% ±2.3 | — | 24 Sep 2024 | 27 Jan 2025 | Log ↗ | |
| 68 | Qwen2-72B Open source Alibaba | 40.8% ±2.6 | — | 7 Jun 2024 | 27 Jan 2025 | Log ↗ | |
| 69 | Llama 3-70B Open source Meta AI | 40.6% ±2.6 | — | 18 Apr 2024 | 27 Jan 2025 | Log ↗ | |
| 70 | Gemma 3 12B Open source Google | 39.5% ±2.5 | — | 12 Mar 2025 | 28 Aug 2026 | Log ↗ | |
| 71 | Qwen3-1.7B Open source Alibaba | 38.0% ±2.7 | — | 29 Apr 2025 | 28 Aug 2026 | Log ↗ | |
| 72 | Hermes 2 Theta Llama-3 70B Open source Nous Research,Arcee AI | 37.5% ±2.5 | — | 20 Jun 2024 | 27 Jan 2025 | Log ↗ | |
| 73 | Gemma 2 27B Open source Google | 36.5% ±2.4 | — | 24 Jun 2024 | 27 Jan 2025 | Log ↗ | |
| 74 | Qwen2.5-7B Open source Alibaba | 35.5% ±2.3 | — | 19 Sep 2024 | 30 Aug 2026 | Log ↗ | |
| 75 | Mixtral 8x22B Open source Mistral AI | 34.1% ±2.1 | — | 17 Apr 2024 | 27 Jan 2025 | Log ↗ | |
| 76 | Eurus-2-7B-PRIME Open source Tsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute | 33.9% ±2.1 | — | 31 Dec 2024 | 27 Jan 2025 | Log ↗ | |
| 77 | DeepSeek-R1-Distill-Qwen-1.5B Open source DeepSeek | 33.6% ±2.1 | — | 20 Jan 2025 | 28 Aug 2026 | Log ↗ | |
| 78 | DBRX Open source Databricks | 32.9% ±3.3 | — | 27 Mar 2024 | 27 Jan 2025 | Log ↗ | |
| 79 | Yi-1.5-34B Open source 01.AI | 32.0% ±2.0 | — | 13 May 2024 | 27 Jan 2025 | Log ↗ | |
| 80 | Qwen1.5-32B Open source Alibaba | 30.7% ±2.0 | — | 3 Apr 2024 | 27 Jan 2025 | Log ↗ | |
| 81 | Mixtral 8x7B Open source Mistral AI | 30.6% ±1.9 | — | 11 Dec 2023 | 27 Jan 2025 | Log ↗ | |
| 82 | Mistral Nemo Open source Mistral | 29.9% ±2.1 | — | 18 Jul 2024 | 27 Jan 2025 | Log ↗ | |
| 83 | Qwen1.5-72B Open source Alibaba | 28.8% ±2.0 | — | 4 Feb 2024 | 27 Jan 2025 | Log ↗ | |
| 84 | Granite 4.0 Micro Open source IBM | 28.3% ±1.8 | — | 20 Oct 2025 | 30 Aug 2026 | Log ↗ | |
| 85 | phi-3-medium 14B Open source Microsoft | 27.6% ±1.6 | — | 23 Apr 2024 | 31 Jan 2025 | Log ↗ | |
| 86 | Gemma 2 9B Open source Google DeepMind | 27.5% ±2.3 | — | 24 Jun 2024 | 27 Jan 2025 | Log ↗ | |
| 87 | Ministral 8B Open source Mistral AI | 27.1% ±2.1 | — | 16 Oct 2024 | 27 Jan 2025 | Log ↗ | |
| 88 | Llama 3.1-8B Open source Meta AI | 27.0% ±1.9 | — | 23 Jul 2024 | 27 Aug 2026 | Log ↗ | |
| 89 | Llama 2-70B Open source Meta AI | 26.3% ±2.0 | — | 18 Jul 2023 | 27 Jan 2025 | Log ↗ | |
| 90 | Llama 3-8B Open source Meta AI | 26.1% ±1.7 | — | 18 Apr 2024 | 27 Jan 2025 | Log ↗ | |
| 91 | DeepSeek LLM 67B Open source DeepSeek | 24.6% ±1.4 | — | 29 Nov 2023 | 27 Jan 2025 | Log ↗ | |
| 92 | Llama 3.2 1B Open source Meta AI | 23.9% ±1.6 | — | 24 Sep 2024 | 30 Aug 2026 | Log ↗ | |
| 93 | Gemma 3 4B Open source Google | 23.2% ±1.9 | — | 12 Mar 2025 | 28 Aug 2026 | Log ↗ | |
| 94 | Gemma 3 1B Open source Google DeepMind | 19.9% ±1.5 | — | 12 Mar 2025 | 28 Aug 2026 | Log ↗ | |
| 95 | Mistral 7B v0.3 Open source Mistral AI | 15.2% ±1.0 | — | 27 May 2024 | 27 Jan 2025 | Log ↗ | |
| 96 | Yi-34B Open source 01.AI | 14.7% ±1.1 | — | 2 Nov 2023 | 27 Jan 2025 | Log ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.