Skip to content
reasoning benchmark · included in ECI

DTBench

DTBench benchmark (score column: Accuracy).
Results
71
Random baseline
40.0%
Score ceiling
100%
Released
12 Aug 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V4 Pro 0813 (unknown) Open source
DeepSeek
93.9%Source ↗
2GLM 5.2 Open source
Z.ai
93.6%Source ↗
3Kimi K3 Open source
MoonshotAI
91.2%Source ↗
4DeepSeek V4 Flash 0731 Open source
DeepSeek
90.9%Source ↗
5Kimi K2.6 Open source
MoonshotAI
90.9%Source ↗
6DeepSeek v4 Pro (high) Open source
DeepSeek
90.7%Source ↗
7Nemotron 3 Ultra Open source
NVIDIA
90.1%Source ↗
8DeepSeek V4.1 Flash (unknown) Open source
DeepSeek
89.9%Source ↗
9Qwen3.8 27B Open source
Qwen
88.0%Source ↗
10DeepSeek V3.2 Exp Open source
DeepSeek
87.7%Source ↗
11Inkling (xhigh) Open source
Thinking Machines
87.5%Source ↗
12Qwen3.5 397B A17B Open source
Qwen
87.5%Source ↗
13DeepSeek v4 Flash (max) Open source
DeepSeek
86.4%Source ↗
14DeepSeek-V3.2 (Thinking; Novita) Open source
DeepSeek
85.6%Source ↗
15MiMo-V2.5-Pro Open source
Xiaomi
84.5%Source ↗
16Qwen3.5-122B-A10B Open source
Qwen
84.3%Source ↗
17Gemma 4 31B Open source
Google
82.7%Source ↗
18DeepSeek V3.1 Open source
DeepSeek
82.7%Source ↗
19Qwen3.5-27B Open source
Qwen
82.4%Source ↗
20DeepSeek V3.1 Terminus Open source
DeepSeek
81.3%Source ↗
21Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
80.3%Source ↗
22Qwen3.5-35B-A3B Open source
Qwen
80.0%Source ↗
23MiniMax M3 Open source
MiniMax
78.9%Source ↗
24Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
78.4%Source ↗
25Qwen3.6 27B Open source
Qwen
78.1%Source ↗
26gpt-oss-120b Open source
OpenAI
76.3%Source ↗
27Qwen3 235B A22B Open source
Qwen
75.7%Source ↗
28Mistral Medium 3.5 Open source
Mistral
75.5%Source ↗
29Gemma 4 26B A4B Open source
Google
74.9%Source ↗
30Qwen3.6 35B A3B Open source
Qwen
73.9%Source ↗
31Qwen3.5-9B Open source
Qwen
71.2%Source ↗
32Mistral Small 4 Open source
Mistral
70.9%Source ↗
33Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
69.3%Source ↗
34gpt-oss-20b Open source
OpenAI
68.0%Source ↗
35Qwen3 32B Open source
Qwen
67.5%Source ↗
36Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
67.2%Source ↗
37Mistral Large 3 Open source
Mistral AI
65.1%Source ↗
38DeepSeek-V3 (Mar 2025) Open source
DeepSeek
64.8%Source ↗
39Qwen3 14B Open source
Qwen
64.0%Source ↗
40Qwen2.5-72B Open source
Alibaba
62.9%Source ↗
41DeepSeek V3.2 Open source
DeepSeek
62.7%Source ↗
42Llama 4 Maverick Open source
Meta
61.9%Source ↗
43Llama 3.1-405B Open source
Meta AI
61.4%Source ↗
44Cohere Command A Open source
Cohere
61.3%Source ↗
45Magistral Small 1.2 Open source
Mistral AI
61.3%Source ↗
46Mistral Large 2 (Jul 2024) Open source
Mistral AI
61.2%Source ↗
47Mistral Large 2 (Nov 2024) Open source
Mistral AI
60.8%Source ↗
48Qwen3 30B A3B Open source
Qwen
60.3%Source ↗
49Llama 3.1-70B Open source
Meta AI
60.0%Source ↗
50Mistral Small 3.2 Open source
Mistral AI
59.9%Source ↗
51Qwen3 8B Open source
Qwen
59.7%Source ↗
52Llama 3.3 70B Open source
Meta AI
59.5%Source ↗
53Mistral Small 3.1 Open source
Mistral AI
58.6%Source ↗
54Llama 4 Scout Open source
Meta
57.9%Source ↗
55Mixtral 8x22B Open source
Mistral AI
55.1%Source ↗
56Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
54.9%Source ↗
57Llama 3-70B Open source
Meta AI
54.2%Source ↗
58Gemma 3 27B Open source
Google
52.5%Source ↗
59Gemma 3 4B Open source
Google
50.9%Source ↗
60Llama 3.1-8B Open source
Meta AI
50.9%Source ↗
61Mixtral 8x7B Open source
Mistral AI
49.6%Source ↗
62Mistral Small v24.09 Open source
Mistral AI
49.5%Source ↗
63Gemma 3 12B Open source
Google
48.8%Source ↗
64Mistral Nemo Open source
Mistral
48.6%Source ↗
65Gemma 2 27B Open source
Google
48.0%Source ↗
66Qwen2.5-7B Open source
Alibaba
47.7%Source ↗
67Ministral 8B Open source
Mistral AI
45.7%Source ↗
68Llama 3-8B Open source
Meta AI
43.9%Source ↗
69Mistral 7B v0.3 Open source
Mistral AI
42.5%Source ↗
70Llama 2-13B Open source
Meta AI
42.2%Source ↗
71Llama 2-70B Open source
Meta AI
41.6%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.