Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
32.69Pretrain Score
9
Feb 26, 2026
4.44Perplexity
9
Feb 26, 2026
10.18Validation PPL
9
Feb 26, 2026
38.2Test Perplexity (0.1 epochs)
9
Feb 26, 2026
0.941Accuracy
9
Feb 26, 2026
0.941Accuracy
9
Feb 26, 2026
94.12Accuracy
9
Feb 26, 2026
9.34PPLexact
8
Jul 7, 2026
6.008Full Perplexity (PPL)
8
Jun 9, 2026
59.3Accuracy
8
Jun 5, 2026
6.1Perplexity
8
Jun 4, 2026
4.568Perplexity
8
May 28, 2026
5.241Perplexity
8
May 28, 2026
24.6∆PPL (%)
8
May 27, 2026
3.504bpw
8
May 27, 2026
33.22Perplexity
8
May 22, 2026
72.21Perplexity (zero-shot)
8
May 22, 2026
61.37Perplexity
8
May 22, 2026
4.733Final 50 Train Loss
8
May 21, 2026
2.5Delta PPL (n=1)
8
May 18, 2026
19.98Validation Perplexity
8
May 15, 2026
96.9Accuracy (1024 tokens)
8
May 7, 2026
74.2Average Accuracy
8
Apr 23, 2026
2.54Perplexity
8
Apr 21, 2026
13.77Macro Average
8
Apr 16, 2026