Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
2.29Training Loss
7
Jun 2, 2026
21.2TPS (tokens/sec)
7
Jun 1, 2026
69.2Throughput (tokens/sec)
7
Jun 1, 2026
35.44PPL
7
May 29, 2026
16.29Perplexity
7
May 29, 2026
2Retention Drift (%)
7
May 29, 2026
4Retention Drift (Δ%)
7
May 29, 2026
4.753Perplexity
7
May 27, 2026
1.128Validation Loss (nats/token)
7
May 26, 2026
8.27Validation Perplexity
7
May 21, 2026
4.91NLL
7
May 15, 2026
1.293Perplexity
7
May 11, 2026
3.32Perplexity
7
Apr 16, 2026
1.285Loss
7
Apr 13, 2026
2.69CE (128-255 tokens)
7
Mar 17, 2026
48.67Perplexity
7
Feb 26, 2026
7.15Perplexity
7
Feb 26, 2026
40.7gPPL
7
Feb 26, 2026
62.58gPPL
7
Feb 26, 2026
47.78Generalized Perplexity
7
Feb 26, 2026
11.72Wiki-PPL
7
Feb 26, 2026
17.81Perplexity
7
Jun 16, 2026
5.95Perplexity (PPL)
7
Feb 26, 2026
11.7Perplexity
7
Feb 26, 2026
12.3Perplexity
7
Feb 26, 2026