Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
16.2Perplexity
104
Feb 26, 2026
48.5PPL (Generalized)
93
May 11, 2026
3.32Perplexity
88
Feb 26, 2026
4.41WikiText-2 Score
86
Jul 9, 2026
17.5Perplexity (PPL)
79
May 26, 2026
2.589Loss
78
Jul 7, 2026
14.36Perplexity (Lambada)
78
Jun 30, 2026
15.06Gen. PPL
78
Jun 1, 2026
2.97Perplexity (PPL)
77
Jun 1, 2026
0.695Validation BPB
76
May 22, 2026
93.039Average Kurtosis
72
May 19, 2026
49.95Perplexity
72
Feb 26, 2026
46.63Perplexity
70
Feb 27, 2026
11.18Perplexity
69
Mar 12, 2026
4.88Perplexity
69
Jul 9, 2026
16.57Perplexity
67
May 26, 2026
1.875Loss
66
Jun 4, 2026
22.8Perplexity
65
Jun 30, 2026
3.52PPL
64
Jun 23, 2026
1.602Validation Loss
64
Jun 16, 2026
2.46Perplexity
64
Jun 30, 2026
5.674Perplexity
63
Jun 2, 2026
12.51Perplexity
62
May 26, 2026
3.22Perplexity
61
Mar 5, 2026
7.3WikiText Perplexity
59
May 8, 2026