Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
24.1WT-103 Delta (%)
9
May 29, 2026
2.86Perplexity (PPL)
9
May 29, 2026
9.03Average PPL
9
May 29, 2026
6.84Perplexity (PPL)
9
May 29, 2026
446.8Perplexity (PPL)
9
May 28, 2026
25.92Validation Perplexity
9
May 19, 2026
77.12Accuracy
9
May 12, 2026
48.7ARC-C Accuracy
9
May 8, 2026
12.723Perplexity
9
May 6, 2026
11.49Perplexity (PPL)
9
Apr 29, 2026
14.58Macro Avg Value
9
Apr 16, 2026
8.3PPL Change (%)
9
Apr 7, 2026
24.7PPL
9
Apr 6, 2026
58.5Accuracy
9
Mar 31, 2026
13.75Perplexity
9
Mar 24, 2026
94.92LM Score
9
Mar 9, 2026
202Perplexity Win Rate
9
Mar 9, 2026
1.577Loss
9
Apr 13, 2026
569.3Perplexity
9
Feb 27, 2026
2.5Perplexity (PPL)
9
Feb 26, 2026
12.11Perplexity
9
Jun 4, 2026
14.13PPL
9
Feb 26, 2026
51.45Perplexity
9
Feb 26, 2026
3.608Worst Log-Perplexity
9
Feb 26, 2026
87.82Pretrain Score
9
Feb 26, 2026