Aggregate
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Aggregate Across Math, Code, Chat
4.91Speedup
20
Aggregate All tasks (summary)
74.6Score
20
Aggregate (MVBench, EgoSchema, NExT-QA, VideoMME)
56.4Aggregate Score
19
Aggregate MATH-500, AIME, MBPP+, HE+, MMLU
63.5Average Performance (Aggregate)
18
Aggregate Easy and Hard Benchmarks
63.7Accuracy
18
Aggregate (MMLU, HellaSwag, ARC-C, GPQA, MBPP, GSM8K)
0.99TPR@1
18
Aggregate MATH, Minerva, Olympiad, GAO, AMC23, AIME24, AIME25
53.36Average Score
18
Aggregate
60.47Average Accuracy
18
Aggregate FTWP, ScienceWorld, WebShop
89.74Format Faithfulness Rate
17
Aggregate JBB, SR, WJ
13.9Reasoning Average
17
Aggregate GPQA, HLE, MMLU-Pro
44.6Average Score
17
Aggregate All Domains
38.14Average Accuracy
16
Aggregate AIME, MedQA, MBPP+, GPQA
71.4Average Accuracy
16
Aggregate BBH, MMLU, ARC-C, ThmQA
26.27Mean Score
16
Aggregate HotPotQA, LiveBench-Math, Formula
74.3Aggregate Score
16
Aggregate Non-MME Suite
86.62Average Accuracy
16
Aggregate CIFAR-10, Food, STL, ObjectNet, ImageNet
95.4Average Score
16
Aggregate (MMLU, GSM8K, SQuAD V2, Amazon, 20News)
77.11Average Score
16
Aggregate AlpacaEval, TruthfulQA, GSM8K, DROP, AGI Eval, BBH, MMLU
44.7Average Score
16
Aggregate All Benchmarks
62.03Average Accuracy
16
Aggregate Sokoban, FrozenLake, Navigation, PrimitiveSkill
93Overall Success Rate
15
Aggregate (MATH-500, AIME24, AIME25, GPQA-diamond)
71.49Accuracy
15
Aggregate (AIME’24, AIME’25, MATH 500, AMC’23, GPQA Diamond) (test)
14.64AAI
15
Aggregate AIME24, AMC, MATH500, Minerva, Olympiad bench
22.7Accuracy Delta (%)
15
Aggregate of 16 tasks
93.5LCS (Avg)
14