Language Modeling and Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
78.6Accuracy (ARC-E)
39
Jun 12, 2026
82.8ARC
33
Feb 26, 2026
90.98AGIEval (EN)
20
Mar 26, 2026
24Avg Score
8
Feb 26, 2026
54.61ARC (Accuracy)
3
Feb 26, 2026