Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
18.22Perplexity
34
May 26, 2026
12.76PPL
34
Feb 26, 2026
32MAUVE
33
May 14, 2026
58Mauve
33
May 14, 2026
0.9Mauve
33
May 14, 2026
0.44Delta PPL
32
Apr 28, 2026
18.08Word Perplexity
32
Mar 25, 2026
4.85Perplexity (PPL)
32
Apr 13, 2026
1.66NLL
32
Feb 26, 2026
8.31PPL
31
Jul 2, 2026
0.1PPL Change (%) vs Baseline
30
Apr 7, 2026
73.2Accuracy
30
Apr 2, 2026
23.32Perplexity
30
Jun 5, 2026
13.33Perplexity
30
Apr 27, 2026
4.645Perplexity (WikiText-2)
30
Feb 26, 2026
41.35Perplexity
30
Jun 9, 2026
51.25Perplexity
30
Jun 9, 2026
7.32Perplexity
30
May 12, 2026
18.43Perplexity
29
Jun 11, 2026
14.79Perplexity
28
Jul 7, 2026
16.84Perplexity
28
Apr 21, 2026
20.98Validation Perplexity
28
May 25, 2026
18.85Validation Perplexity
28
Apr 21, 2026
20.69Validation Perplexity
28
Apr 21, 2026
0PPL Change (%)
28
Apr 7, 2026