General Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
64.77Average Score
24
Feb 26, 2026
31.1Accuracy
17
Jun 9, 2026
87.84Performance (%)
16
May 26, 2026
85.6Accuracy
12
May 12, 2026
66.5Generation Quality Score
11
Feb 26, 2026
Combined Suite (HS, PIQA, SIQA, Wino, MMLU, NQ, TQA, ARC-C, ARC-E, OBQA, BoolQ, DROP, BBH-LB, GSM8K)
57.8Accuracy
4
May 27, 2026
73.6Average Score
4
Feb 26, 2026
83.6Accuracy
2
May 12, 2026
88.9Comprehensive Score
2
Apr 10, 2026