Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
81.9Perplexity
6
Feb 26, 2026
52.73Validation Perplexity
6
Feb 26, 2026
2.32LM Loss
6
Feb 26, 2026
27.9LAM Accuracy
5
Jul 1, 2026
3.8Delta PPL (%)
5
Jun 23, 2026
20.51Perplexity (PPL)
5
Jun 12, 2026
3.887Final Validation Loss
5
Jun 4, 2026
14.6Latency (ms/token)
5
May 29, 2026
0.008RMSLE
5
May 27, 2026
48.78Perplexity
5
May 21, 2026
3.25Validation Loss
5
May 19, 2026
15.22Perplexity
5
May 14, 2026
16.01Validation Perplexity (40K steps)
5
May 14, 2026
15.34Perplexity
5
May 12, 2026
6.49Final Perplexity (PPL)
5
May 12, 2026
3.01Validation CE
5
May 13, 2026
16.34Perplexity
5
May 8, 2026
21.55PPL
5
May 8, 2026
29.65Perplexity (PPL)
5
May 8, 2026
14.94PPL
5
Apr 24, 2026
20.8Perplexity
5
Apr 14, 2026
16Perplexity
5
Apr 14, 2026
15.2Perplexity
5
Apr 14, 2026
20.6Perplexity
5
Apr 14, 2026
25.5Perplexity
5
Apr 14, 2026