Downstream Task Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
63.6ARC-c Accuracy
39
May 15, 2026
70.5MMLU
19
May 26, 2026
65.8MMLU
16
Feb 26, 2026
63.95MMLU (5-shot)
14
Feb 26, 2026
45LAMBADA (OpenAI)
12
Mar 4, 2026
60.49Accuracy
11
Apr 21, 2026
52.79Average Accuracy
9
Apr 21, 2026
2Median EG
7
Feb 26, 2026
77.7Accuracy (BoolQ)
5
May 19, 2026
66.72ARC Challenge Accuracy
5
May 14, 2026
32.43Throughput (tokens/s)
4
Apr 24, 2026
52.21HellaSwag Accuracy
3
Jul 7, 2026
0.385MNLI Acc
2
Feb 26, 2026