Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
9.42Average Perplexity
19
Feb 26, 2026
15.18PPL
19
Jun 1, 2026
3.36Perplexity
19
May 14, 2026
99.9Perplexity
19
Feb 26, 2026
2.94Train Loss
18
Jul 7, 2026
0.835Evaluation Loss
18
Jun 24, 2026
0.76Evaluation Loss
18
Jun 24, 2026
31.82Perplexity
18
Jun 5, 2026
11.9PPL Delta (%)
18
May 18, 2026
87Mauve
18
May 7, 2026
173.704Base Score
18
May 6, 2026
0.2PPL Change vs Baseline
18
Apr 7, 2026
2.221Valid Loss
18
Feb 26, 2026
2.278CE Loss
18
Feb 26, 2026
5.47Perplexity
18
Mar 19, 2026
-325.7Prior LL
18
Feb 26, 2026
89.7EM Accuracy
18
Apr 10, 2026
10.83PPL
18
Jul 9, 2026
81.64Perplexity
18
Feb 26, 2026
20PPL (10% sparsity)
17
Jul 3, 2026
7.33Perplexity (PPL)
17
Jun 23, 2026
24.35Average Perplexity
17
Jun 4, 2026
32.85ARC-C Accuracy
17
May 19, 2026
60.47Zero-shot Average Accuracy
17
May 15, 2026
15.33Perplexity
17
Jun 24, 2026