Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
4.8PPL
10
Feb 26, 2026
33.19PPL (64)
10
Jul 7, 2026
7.91Fluency
10
Feb 26, 2026
1.762Overall Loss
10
Feb 26, 2026
36.41WER
10
Feb 26, 2026
5.94WER
10
Feb 26, 2026
0.051WER
10
Feb 26, 2026
15.31PPLX
10
Feb 26, 2026
7.78Perplexity
10
Feb 26, 2026
8.99Perplexity
10
Feb 26, 2026
9.07Perplexity
10
Feb 26, 2026
8.96Perplexity
10
Feb 26, 2026
9.08Perplexity
10
Feb 26, 2026
8.14Perplexity
10
Feb 26, 2026
22.78Perplexity
10
Feb 26, 2026
22.72PPL
10
Feb 26, 2026
35.1Perplexity
10
Feb 26, 2026
4.74Perplexity
9
Jul 9, 2026
71.8PASS-AT-1 Accuracy
9
Jun 17, 2026
26.67Cumulative Orthogonalization Cost (PFLOPs)
9
Jun 16, 2026
15.42Perplexity (C4)
9
Jun 11, 2026
87.89Runtime
9
Jun 9, 2026
52Time to Target (min)
9
Jun 4, 2026
6.32Perplexity (PPL)
9
May 29, 2026
8.53Perplexity
9
May 29, 2026