Zero-shot Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
80.66WG
30
Feb 26, 2026
19.21WikiText-103 Perplexity
19
Jun 9, 2026
79.6Accuracy
8
Feb 26, 2026
9.6Perplexity (PPL)
5
May 19, 2026
28.16ARC-Challenge Acc
5
Feb 26, 2026
84.2Accuracy
4
Feb 26, 2026
25.46Wikitext Perplexity
2
Feb 26, 2026