Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
23.5Word-Perplexity
11
Feb 26, 2026
26.6Perplexity
11
May 7, 2026
39.15PPL
11
Feb 26, 2026
63.83PPL
11
Feb 26, 2026
10.19PPL (LM)
11
Feb 26, 2026
37.26Normalized Accuracy
10
Jun 29, 2026
16NGL
10
Jun 5, 2026
11.07Perplexity
10
Jun 2, 2026
2.241Loss
10
Jun 1, 2026
35.37Perplexity (PPL)
10
Jun 1, 2026
33.76Perplexity (PPL)
10
Jun 1, 2026
40.83Validation Perplexity
10
Jun 1, 2026
30.87Training Perplexity
10
Jun 1, 2026
9.603Perplexity (PPL)
10
May 28, 2026
5.29Perplexity (PPL)
10
May 28, 2026
9.96Perplexity (PPL)
10
May 14, 2026
16.22Score at 30K Tokens
10
May 8, 2026
20.53Perplexity
10
Apr 15, 2026
3.156Loss
10
Apr 13, 2026
123.3Perplexity
10
Mar 24, 2026
218.8Perplexity
10
Mar 24, 2026
47.06Accuracy
10
Mar 11, 2026
2.707Validation Loss
10
Feb 26, 2026
17.33Perplexity
10
Feb 26, 2026
-25.41GEN Loss
10
Feb 26, 2026