Massive Multitask Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
83.34Accuracy
137
Jul 3, 2026
88.3Accuracy (MMLU-Pro)
122
Jun 16, 2026
84.2MMLU Accuracy
55
Jun 4, 2026
82.57Accuracy
42
May 29, 2026
53Accuracy
30
Apr 20, 2026
49.8Accuracy
18
Jun 19, 2026
56.6MMLU
16
Apr 21, 2026
41.2MMLU Accuracy (ar)
15
May 28, 2026
61.9MMLU FL Score
14
Feb 26, 2026
68.21Avg@k
12
May 13, 2026
59.69MMLU (5-shot)
11
Jul 9, 2026
67.84Accuracy
10
May 12, 2026
36.28MMLU Humanities Accuracy
9
Mar 4, 2026
24.1Accuracy
7
Feb 26, 2026
82.7STEM Accuracy
6
May 7, 2026
0.001vNMSE
6
Feb 26, 2026
87.68Pass@1 Score
5
May 12, 2026
17.47LLMcritic Calls
5
May 11, 2026
2.39CPr-value
4
May 25, 2026
24.8MMLU hi Accuracy
3
May 14, 2026
23.5Accuracy
3
May 14, 2026
38.6Normalized Log Accuracy
3
Mar 18, 2026
64.9Normalized Log Accuracy
3
Mar 18, 2026
67Normalized Log Accuracy
3
Mar 18, 2026
0.45MMLU Log-likelihood Score
2
Apr 2, 2026