Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
6.43Perplexity
59
May 29, 2026
9.36Perplexity
58
Jun 2, 2026
16.46Perplexity (Test)
58
Jun 2, 2026
10.48Perplexity
56
May 13, 2026
19.54Validation Perplexity
56
May 25, 2026
0.62Perplexity (bits/byte)
55
Jul 9, 2026
1PPL Degradation
53
Jun 2, 2026
83.2Accuracy
53
Mar 25, 2026
9.213PPL (The Pile Test)
53
Jun 2, 2026
7.15Average Perplexity
52
Mar 18, 2026
8.71Perplexity
51
Jun 1, 2026
56.2Accuracy
50
Jul 7, 2026
15.28PPL
50
May 22, 2026
2.5Perplexity
50
Feb 26, 2026
2.493Validation Loss
49
May 14, 2026
326.7NLL
48
Feb 26, 2026
0.1Perplexity
47
Jul 7, 2026
7.77Perplexity
47
Jul 3, 2026
14.4PPL
46
May 18, 2026
4.76PPL
45
Jun 30, 2026
78.71SNLG Score
44
Feb 26, 2026
69.12Accuracy (zero-shot)
44
Jun 9, 2026
5.47Perplexity (PPL)
43
May 19, 2026
9.17Perplexity
43
May 28, 2026
0.16Cross-Entropy
42
Mar 5, 2026