General Language Understanding and Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
35.68MMLU Accuracy
70
Apr 14, 2026
60.08Accuracy
50
Mar 6, 2026
85.32HellaSwag Accuracy
30
May 26, 2026
59C-STANCE Accuracy
29
Feb 26, 2026
44.97MMLU-Pro
20
Jun 4, 2026
59.3MMLU
18
Jun 5, 2026
91.07Mean Accuracy
17
Feb 26, 2026
93.3DROP Score
16
Feb 27, 2026
69.07IFEval Score
14
Apr 29, 2026
83.7Accuracy
14
Feb 26, 2026
45.9ARC
14
Feb 26, 2026
59.9Average Score
10
Feb 26, 2026
61.91Average Accuracy
8
Jun 2, 2026
62.5ARC-Challenge Accuracy
5
May 4, 2026
72.7BBH
4
Feb 26, 2026
—
—Primary metric
0
Apr 29, 2026