Skip to content

Best for reasoning

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
151Tulu 3 (Tülu 3) 70BAllen Institute for AI—46.3———
152Qwen2.5-32BAlibaba (Qwen)128.546.1———
153Gemini 1.5 Pro (May 2024)Google126.945.9———
154qwen3-4b-instruct-2507—45.8———
155DeepSeek-R1-Distill-Qwen-14BDeepSeek135.444.7———
156Llama 3.1-70BMeta125.944.2———
157WizardLM-2 8x22BMicrosoft—43.4—66K$0.62
158GPT-4 Turbo Preview (Nov 2023)OpenAI—42.4———
159GPT-4 Turbo Preview (January 2024)OpenAI—42.3———
160Qwen-TurboAlibaba (Qwen)—41.8———
161Llama 3.2 90BMeta125.541.0———
162Qwen2-72BAlibaba (Qwen)125.340.8———
163Claude 3 SonnetAnthropic120.740.6———
164Llama 3-70BMeta122.940.6———
165Gemini 1.5 Flash (May 2024)Google122.640.4———
166Gemma 3 12BGoogle123.539.5—131K$0.075
167Mistral LargeMistral AI122.038.8—128K$3.00
168Claude 3.5 Haiku (Oct 2024)Anthropic—38.1———
169Qwen3-1.7BAlibaba (Qwen)—38.0———
170GPT-4o-miniOpenAI126.637.7—128K$0.26
171Hermes 2 Theta Llama-3 70BNous Research—37.5———
172Gemma 2 27BGoogle122.136.5—8K$0.65
173Claude 3 HaikuAnthropic118.336.3———
174GPT-4 (Mar 2023)OpenAI125.935.7———
175Qwen2.5-7BAlibaba (Qwen)118.435.5———
176Claude 2Anthropic120.134.7———
177Mixtral 8x22BMistral AI122.034.1———
178Gemini 1.0 ProGoogle117.034.0———
179Eurus-2-7B-PRIMETsinghua University,University of Illinois Urbana-Champaign (UIUC),Shanghai AI Lab,Peking University,Shanghai Jiao Tong University,CUHK Shenzhen Research Institute—33.9———
180DeepSeek-R1-Distill-Qwen-1.5BDeepSeek—33.6———
181Claude 2.1Anthropic119.233.0———
182Gemini 1.5 Flash 8BGoogle—33.0———
183DBRXDatabricks—32.9———
184Yi-1.5-34B01.AI—32.0———
185Qwen1.5-32BAlibaba (Qwen)—30.7———
186GPT-4 (Jun 2023)OpenAI123.130.7———
187Mixtral 8x7BMistral AI118.430.6———
188Mistral NemoMistral AI118.629.9—131K$0.022
189Qwen1.5-72BAlibaba (Qwen)—28.8———
190Granite 4.0 MicroIBM—28.3—131K$0.041
191GPT-3.5 Turbo (Nov 2023)OpenAI118.528.0———
192phi-3-medium 14BMicrosoft121.227.6———
193Gemma 2 9BGoogle119.827.5———
194GPT-3.5 Turbo (Jan 2024)OpenAI115.627.2———
195Ministral 8BMistral AI—27.1———
196Llama 3.1-8BMeta116.527.0———
197Llama 2-70BMeta113.626.3———
198Llama 3-8BMeta116.326.1———
199Ministral 3BMistral AI118.125.3———
200DeepSeek LLM 67BDeepSeek110.524.6———
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research