Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
14.42PPL
13
Apr 21, 2026
3.09Perplexity
13
Apr 10, 2026
17.94Perplexity
13
Feb 26, 2026
1.83Perplexity
13
Feb 26, 2026
31.18Perplexity
13
Feb 26, 2026
19.35Perplexity
13
Feb 26, 2026
11.95Perplexity
13
Feb 26, 2026
44.9Perplexity
13
Feb 26, 2026
4.67Perplexity (Wikitext-2)
12
Jun 5, 2026
13.9C4 Score
12
Jun 1, 2026
7.59Perplexity
12
May 28, 2026
7.5PPL (Uniform)
12
May 11, 2026
8.49Perplexity (BF16)
12
Apr 24, 2026
19.96Validation Perplexity
12
Apr 14, 2026
27.95Validation Perplexity
12
Apr 14, 2026
2.09EW Loss
12
Mar 25, 2026
5.23Decode Latency
12
Mar 25, 2026
8.87Perplexity (PPL)
12
Mar 19, 2026
5.67PPL
12
Mar 19, 2026
14.1Perplexity (PPL)
12
Mar 17, 2026
76.9Mean Perplexity
12
Mar 9, 2026
12.61Perplexity
12
Mar 4, 2026
10.01Perplexity
12
Mar 4, 2026
2.917Training Loss
12
Apr 20, 2026
1.32Loss
12
Feb 26, 2026