Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
5.13NLL
5
Feb 26, 2026
1.66NLL
5
Feb 26, 2026
1.7NLL
5
Feb 26, 2026
1.808Loss
5
Feb 26, 2026
82.8BLIMP
5
Feb 26, 2026
75.8BLIMP Score
5
Feb 26, 2026
0.295WER
5
Feb 26, 2026
0.063WER
5
Feb 26, 2026
5.25WER
5
Feb 26, 2026
3.99WER
5
Feb 26, 2026
3.56WER
5
Feb 26, 2026
93.04Accuracy
5
Feb 27, 2026
71.8Perplexity
5
Feb 26, 2026
71.8PPL
5
Feb 26, 2026
26.67Perplexity
5
Feb 26, 2026
206Perplexity
5
Feb 26, 2026
159Perplexity
5
Feb 26, 2026
145Perplexity
5
Feb 26, 2026
206Perplexity
5
Feb 26, 2026
312Perplexity
5
Feb 26, 2026
0.749Bits/Byte
4
Jul 8, 2026
58.48Perplexity
4
Jul 7, 2026
18.32Perplexity (Dev)
4
Jul 1, 2026
1.689Validation Loss
4
Jun 23, 2026
1.275Loss
4
Jun 23, 2026