Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3.41Loss
3
Apr 20, 2026
1.683Average Loss
3
Apr 3, 2026
8.1Perplexity (PPL)
3
Mar 25, 2026
22.1Perplexity (PPL)
3
Mar 25, 2026
7.7Perplexity (PPL)
3
Mar 25, 2026
3Perplexity (PPL)
3
Mar 25, 2026
47.1Accuracy
3
Mar 18, 2026
21.45Held-out Perplexity
3
Mar 11, 2026
15.1Training PPL
3
Mar 11, 2026
21.45Perplexity (Evaluation Prompts)
3
Mar 11, 2026
3.81Test PPL
3
Mar 4, 2026
40.8Gap Closed (%)
3
Mar 4, 2026
25.72PPL (Val)
3
Feb 26, 2026
0.392Accuracy
3
Feb 26, 2026
28.75Accuracy
3
Feb 26, 2026
1.617Cross-Entropy Loss
3
Feb 26, 2026
5.12PPL
3
Feb 26, 2026
0.96Normalized Energy
3
Feb 26, 2026
3.271Loss
3
Feb 26, 2026
28.37Perplexity (PPL)
3
Feb 26, 2026
92.1Accuracy
3
Feb 26, 2026
33.95Perplexity
3
Feb 26, 2026
3.07Perplexity
3
Feb 26, 2026
9.219Perplexity
3
Feb 26, 2026
4.43Perplexity
3
Feb 26, 2026