Multi-task Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
87.28Accuracy
24
Jun 19, 2026
3.3Latency (s)
24
Feb 26, 2026
44.28ARC Challenge Acc
24
Feb 26, 2026
88.6Biology Score
23
Jun 30, 2026
71.6Accuracy
23
May 8, 2026
62.5PRR
22
Apr 29, 2026
79.7MMLU-Pro Score
22
Jul 3, 2026
0.087Error Rate (ER)
21
May 21, 2026
2.5ECE
21
May 13, 2026
65MMLU Performance (MM)
20
Jun 4, 2026
84.9Accuracy
20
Feb 26, 2026
54.88Accuracy (maj@2)
18
Apr 23, 2026
88pass@1 Accuracy
17
May 7, 2026
81.5Accuracy
16
Mar 18, 2026
10.12Throughput
16
Feb 26, 2026
14,946.31Average Context Length (tokens)
16
Feb 26, 2026
66.6Accuracy
15
Apr 21, 2026
79.95Zero-shot Accuracy
14
Jul 8, 2026
71.08Accuracy
14
Jun 4, 2026
68.71STEM Accuracy
14
May 8, 2026
92MMLU Accuracy
14
Apr 9, 2026
57.6Accuracy
14
Mar 12, 2026
64.29MMLU Score
14
Feb 26, 2026
69.5MMLU Score
14
Feb 26, 2026
95.5PAWS Accuracy
13
Jun 23, 2026