Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
16.11Perplexity
17
May 22, 2026
24.53NELBO PPL
17
Feb 26, 2026
10.98PPL (zero-shot)
17
Feb 26, 2026
20.08Perplexity
17
Feb 26, 2026
42.62Perplexity
16
Jun 4, 2026
44.64Perplexity
16
Jun 4, 2026
3.317Validation Loss
16
Jun 2, 2026
3.229Validation Loss
16
Jun 2, 2026
3.193Validation Loss
16
Jun 2, 2026
3.171Validation Loss
16
Jun 2, 2026
12.701Perplexity
16
May 21, 2026
1.764Perplexity
16
May 20, 2026
14.47Delta Perplexity (ΔPPL)
16
Apr 28, 2026
31Relative PPL Change (%)
16
Apr 7, 2026
2.91Perplexity (2K)
16
Mar 24, 2026
2.993Loss
16
Apr 21, 2026
-9.2Average Delta
16
Mar 4, 2026
36.5Perplexity
16
May 26, 2026
11.5PPL
16
Feb 26, 2026
12MMLU-P Accuracy
16
Feb 26, 2026
1.7PPL Change (%)
16
Apr 7, 2026
5.47PPL (Llama 2, Config 7)
16
Feb 26, 2026
5.307Final Train Loss
16
May 20, 2026
148.5Perplexity (Test)
16
Feb 26, 2026
14.78Validation Perplexity
15
Jul 2, 2026