Skip to content
other benchmark · included in ECI

OpenBookQA

OpenBookQA benchmark (score column: Accuracy).
Results
32
Random baseline
25.0%
Score ceiling
100%
Released
8 Sep 2018

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1phi-3-small 7.4B Open source
Microsoft
88.0%Source ↗
2phi-3-mini 3.8B Open source
Microsoft
88.0%Source ↗
3phi-3-medium 14B Open source
Microsoft
87.4%Source ↗
4GPT-3.5 Turbo (Nov 2023)
OpenAI
86.0%Source ↗
5Mixtral 8x7B Open source
Mistral AI
85.8%Source ↗
6Llama 3-8B Open source
Meta AI
82.6%Source ↗
7Mistral 7B v0.1 Open source
Mistral AI
79.8%Source ↗
8Gemma 7B Open source
Google DeepMind
78.6%Source ↗
9Phi-2 Open source
Microsoft
73.6%Source ↗
10Falcon-180B Open source
Technology Innovation Institute
64.2%Source ↗
11Llama 2-70B Open source
Meta AI
60.2%Source ↗
12LLaMA-65B Open source
Meta AI
60.2%Source ↗
13Llama 2-7B Open source
Meta AI
58.6%Source ↗
14LLaMA-33B Open source
Meta AI
58.6%Source ↗
15Llama 2-34B
Meta AI
58.2%Source ↗
16PaLM 2-M
57.4%Source ↗
17LLaMA-7B Open source
Meta AI
57.2%Source ↗
18Llama 2-13B Open source
Meta AI
57.0%Source ↗
19Falcon-40B Open source
Technology Innovation Institute
56.6%Source ↗
20LLaMA-13B Open source
Meta AI
56.4%Source ↗
21PaLM 2-S
56.2%Source ↗
22MPT-30B Open source
MosaicML
52.0%Source ↗
23Falcon-7B Open source
Technology Innovation Institute
51.6%Source ↗
24MPT-7B Open source
MosaicML
51.4%Source ↗
25XGen-7B Open source
Salesforce
40.2%Source ↗
26RedPajama-INCITE-7B-Base
40.0%Source ↗
27Dolly 2.0-12b Open source
Databricks
39.2%Source ↗
28open_llama_7b
39.0%Source ↗
29Phi-1.5 Open source
Microsoft
37.2%Source ↗
30Cerebras-GPT-13B Open source
Cerebras Systems
35.8%Source ↗
31vicuna-13b-v1.1
33.0%Source ↗
32stablelm-tuned-alpha-7b
32.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.