Multi-task Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
85.7Best-of-K Accuracy
8
Jun 23, 2026
69Accuracy
8
Apr 28, 2026
45.5Average Accuracy
8
Jul 9, 2026
92Normalized Score
8
Apr 23, 2026
69.11Exact Match (EM)
8
Mar 24, 2026
1.49Speedup
8
Mar 5, 2026
47Comparable SC Samples
8
Feb 27, 2026
12.89Throughput
8
Feb 26, 2026
73.9Accuracy
8
Feb 26, 2026
72.7MMLU Accuracy (Before Attack)
8
Feb 26, 2026
83.2Accuracy
7
Jun 23, 2026
73.040-shot Accuracy
7
Jun 4, 2026
82.6MMLU Pro Score
7
May 8, 2026
38.97Aggregate Normalized Accuracy
7
Apr 23, 2026
31.37Acc (Normalized)
7
Apr 23, 2026
33.75Acc (Normalized)
7
Apr 23, 2026
5.31MMLU-Pro Delta (%)
7
Apr 23, 2026
40.4Math Score
6
Jun 8, 2026
70.13Humanities Accuracy
6
Jun 2, 2026
70.21Humanities Accuracy (0-shot)
6
Jun 2, 2026
49.8Accuracy
6
Feb 26, 2026
75.68MMLU Source Lib. Accuracy
5
Jun 19, 2026
100Accuracy under Attack
5
Apr 28, 2026
73.04Accuracy
5
Feb 26, 2026
74.4Accuracy
5
Feb 26, 2026