Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3.14PPL
42
Feb 26, 2026
76.82MMLU Final Performance
42
Apr 23, 2026
0.2PPL Change (%)
41
May 29, 2026
4.24PPL
41
Jun 24, 2026
5.82Perplexity (PPL)
40
Apr 21, 2026
17.9Perplexity
40
Jun 29, 2026
18.504Perplexity
40
May 14, 2026
2.35Perplexity
40
Mar 4, 2026
2.947Average Perplexity
40
Jul 9, 2026
1Entropy
39
Mar 4, 2026
10.14Perplexity
39
May 26, 2026
3.4Perplexity
39
Feb 26, 2026
21.8Perplexity
39
May 15, 2026
2.524Validation Loss
38
May 12, 2026
73.67Accuracy (LAMBADA)
37
Jun 12, 2026
5.56Mean Final Loss
36
May 12, 2026
60.8Accuracy
36
Mar 4, 2026
18.19Perplexity
36
May 26, 2026
6.9Perplexity
36
Feb 26, 2026
4.79NLL
35
May 25, 2026
2.834Log-PPL
35
Feb 26, 2026
1.23BPC
35
May 14, 2026
82.05Perplexity
35
Jun 9, 2026
14.955Perplexity
35
Feb 26, 2026
4.708PPL
35
Feb 26, 2026