Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
62.9HV Score
5
Apr 13, 2026
0.506HV
5
Apr 13, 2026
47.9HV
5
Apr 13, 2026
21.91Perplexity
5
Apr 7, 2026
26.84PPL
5
Apr 7, 2026
2.418EW Loss
5
Mar 25, 2026
4.22Model Size (GB)
5
Mar 19, 2026
2.286Loss
5
Mar 18, 2026
98.2Shifted PPL
5
Mar 17, 2026
2.744Cross Entropy (CE)
5
Mar 11, 2026
3.004Validation Loss (100k steps)
5
Mar 5, 2026
27.9ARC-E Accuracy
5
Mar 4, 2026
1.58Wikitext PPL
5
Mar 4, 2026
6.5Perplexity
5
Feb 26, 2026
23.5Perplexity
5
Feb 26, 2026
0.699Cross-Entropy Loss
5
Feb 26, 2026
283Perplexity
5
Feb 26, 2026
34.56Perplexity
5
Feb 26, 2026
0Difference
5
Feb 26, 2026
2.341Loss
5
Feb 26, 2026
2.341Final Loss
5
Feb 26, 2026
2.12NLL
5
Feb 26, 2026
2.79NLL
5
Feb 26, 2026
2.76NLL
5
Feb 26, 2026
5.12NLL
5
Feb 26, 2026