Multitask Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
73Accuracy
11
Feb 26, 2026
74MMLU
11
Feb 26, 2026
71MMLU Accuracy
11
Feb 26, 2026
26.74Normalized Accuracy (M-MMLU-c)
10
Apr 23, 2026
37.17Accuracy
8
May 14, 2026
77.5MMLU Accuracy
8
May 13, 2026
43.3Accuracy
8
Feb 26, 2026
78.5MMLU Score
7
Feb 26, 2026
64.46Accuracy
6
May 26, 2026
51.6MMLU Accuracy
6
May 15, 2026
68MMLU Accuracy
6
Apr 21, 2026
70.41MMLU Score
6
Feb 26, 2026
43.47Accuracy
6
Feb 26, 2026
89Arabic Accuracy
5
May 1, 2026
57.86RPR
5
Apr 30, 2026
55.14Accuracy
5
Apr 30, 2026
36.35MMLU Aggregate Score
4
May 22, 2026
18Exact Match Accuracy
4
Mar 17, 2026
67.6MMLU Score (%)
4
Mar 6, 2026
4.3Normalized PLL Score
4
Feb 26, 2026
0.1Drift (pp)
3
Jun 23, 2026
32.5Normalized Accuracy
3
Apr 23, 2026
4.46Average Relative Improvement
3
Feb 26, 2026
90.4Accuracy (Arabic)
3
Feb 26, 2026
67Acc (Exact)
3
Feb 26, 2026