Large Language Model Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
61.99MMLU Pro
75
Jun 9, 2026
78.9Average Score
58
Mar 4, 2026
70.56Avg Accuracy
50
Feb 26, 2026
55.37GSM8K
49
Mar 24, 2026
69.84Overall Average Score
44
Feb 26, 2026
74.2Average Score
41
Apr 14, 2026
47.83Average Performance
38
May 7, 2026
84.34HellaSwag
36
May 7, 2026
69.6Average Score
34
May 12, 2026
70.7MMLU
23
Mar 4, 2026
73.7ARC Accuracy
16
Mar 17, 2026
49.6Reading Comprehension Score
14
Feb 26, 2026
80.81MMLU
13
Mar 4, 2026
86.55MMLU Accuracy
13
Mar 4, 2026
84.88cMMLU
11
Feb 26, 2026
3.05Average Rank
10
Mar 4, 2026
88Accuracy
9
Feb 26, 2026
0.455Overall Score
8
Feb 26, 2026
78.1AlpacaEval Score
7
Mar 18, 2026
7.81PPL
6
Mar 10, 2026
9.75Perplexity (PPL)
6
Mar 10, 2026
6.13PPL
6
Mar 10, 2026
4.88Perplexity
6
Mar 10, 2026
5.47PPL
6
Mar 10, 2026
41.56Average Time Cost
6
Feb 26, 2026