Skip to content
other benchmark · included in ECI

LAMBADA

LAMBADA benchmark (score column: Score).
Results
21
Random baseline
0.0%
Score ceiling
100%
Released
20 Jun 2016

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Falcon-180B Open source
Technology Innovation Institute
79.8%Source ↗
2Llama 2-70B Open source
Meta AI
78.9%Source ↗
3Inflection-1
Inflection AI
78.5%Source ↗
4LLaMA-65B Open source
Meta AI
77.7%Source ↗
5Falcon-40B Open source
Technology Innovation Institute
77.3%Source ↗
6LLaMA-33B Open source
Meta AI
77.2%Source ↗
7Llama 2-13B Open source
Meta AI
76.5%Source ↗
8LLaMA-13B Open source
Meta AI
75.2%Source ↗
9Falcon-7B Open source
Technology Innovation Institute
74.9%Source ↗
10Baichuan2-13B Open source
Baichuan
74.0%Source ↗
11Baichuan 2-7B Open source
Baichuan
73.3%Source ↗
12Llama 2-7B Open source
Meta AI
73.3%Source ↗
13LLaMA-7B Open source
Meta AI
73.3%Source ↗
14internlm-20b
71.8%Source ↗
15Stable Beluga 2 Open source
Stability AI
71.3%Source ↗
16Qwen-14B Open source
Alibaba
71.1%Source ↗
17MPT-7B Open source
MosaicML
70.0%Source ↗
18Qwen-7B Open source
Alibaba
67.9%Source ↗
19internlm-7b
67.0%Source ↗
20Qwen-1_8B
58.4%Source ↗
21chatglm2-6b
54.3%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.