Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
8.28Perplexity
20
May 29, 2026
38.53Generative Perplexity
20
May 26, 2026
30.12PPL
20
May 19, 2026
5.05Mean Final Loss
20
May 12, 2026
16.99Perplexity (PPL)
20
May 8, 2026
140.97LAMBADA Score (DE)
20
Apr 10, 2026
24.2PPL Change (%)
20
Apr 7, 2026
5.45PPL (Mistral-7B)
20
Mar 30, 2026
9.06Perplexity (Wikipedia 20k)
20
Mar 30, 2026
29.91Hyper-Prior BPT
20
Feb 26, 2026
4.57Perplexity (PPL)
20
Feb 26, 2026
0.557BPB
20
Feb 26, 2026
15.71Perplexity
20
Feb 26, 2026
40.72PPLX
20
Feb 26, 2026
15.82PPLX
20
Feb 26, 2026
32.8Perplexity
20
Jun 1, 2026
31.8Perplexity
20
Jun 1, 2026
42.41Perplexity
20
Mar 11, 2026
12.34Perplexity
20
Apr 1, 2026
4.91Perplexity (PPL)
19
May 26, 2026
5.12Perplexity (Wiki2)
19
Jun 9, 2026
2.461Loss
19
May 7, 2026
2.398Loss
19
May 7, 2026
2.89LM Loss
19
May 12, 2026
2.6Perplexity (PPL)
19
May 20, 2026