Multilingual Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
66.88Accuracy
52
May 6, 2026
59.6Overall Accuracy
38
Apr 23, 2026
76.1CLCall
30
Mar 6, 2026
79.5Accuracy
28
Jul 7, 2026
43.6Accuracy
24
Apr 23, 2026
79.5Accuracy
21
Feb 26, 2026
60.5Accuracy (Korean)
20
Jul 7, 2026
59.5MC Score
18
Apr 21, 2026
57.83HellaSwag Accuracy
8
Feb 26, 2026
52.48HellaSwag
8
Feb 26, 2026
64.6Average Performance
6
Feb 26, 2026
55.5Average Performance
6
Feb 26, 2026
55.7Average Performance
6
Feb 26, 2026
55.7Average Performance
6
Feb 26, 2026
48.4Average Performance
6
Feb 26, 2026
0.572Average Performance
6
Feb 26, 2026
34.9Arc-ru
6
Feb 26, 2026
68.7Average Performance
5
Feb 26, 2026
54.5Avg Performance
5
Feb 26, 2026
80.7Accuracy
5
Feb 26, 2026
78.2Accuracy (en)
3
Apr 14, 2026
77.81Accuracy
3
Feb 26, 2026
78.94Accuracy
3
Feb 26, 2026
78.3Normalized Log Accuracy (MMMLU)
2
Mar 18, 2026
—
—Primary metric
0
Apr 29, 2026