Zero-shot language evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
7.43WikiText2 Perplexity
27
Apr 23, 2026
9.2Average Normalized Accuracy
10
Mar 4, 2026
60.94Average Score
9
Feb 26, 2026
62.9BoolQ Accuracy
4
Jun 17, 2026
57.93WinoGrande
2
Mar 20, 2026