Multi-task Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
60.1Average Accuracy
13
May 27, 2026
89.1Accuracy
13
May 28, 2026
61Accuracy
12
Jun 11, 2026
62.1Accuracy
12
Jun 11, 2026
0.84Wall-clock Time (s)
12
Jun 11, 2026
71MMLU Accuracy
12
May 12, 2026
66.5Accuracy
12
Apr 7, 2026
47.12Accuracy
12
Mar 20, 2026
100Activation
11
Jun 30, 2026
44.1Average Score
11
Jun 8, 2026
61.08Overall Accuracy
10
Jun 2, 2026
71.1Accuracy
10
May 26, 2026
76.5Accuracy (MMLU-Pro AceReason)
10
May 26, 2026
92.86Performance
10
Apr 2, 2026
77.95Accuracy
10
Mar 23, 2026
72Accuracy
10
Feb 26, 2026
1.33Loss (FT)
10
Feb 26, 2026
54.64Accuracy
10
Feb 27, 2026
80Hindu Knowledge
10
Feb 27, 2026
73.76Avg@8
9
Jul 3, 2026
76.63MMLU Score
9
Jul 3, 2026
75.25Task Success Rate (TSR)
9
May 28, 2026
72.47Accuracy
9
Mar 18, 2026
75Accuracy
9
Mar 4, 2026
64Accuracy
8
Jul 3, 2026