Average
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Average (AVG)
71.25Accuracy
16
Average
3.4Average Rank
16
Average
0.042Absolute Relative Error (Abs Rel)
16
Average
48.01Pass@1
16
Average (PopQA, HotpotQA, 2Wiki, MuSiQue, Bamboogle)
42.54EM
16
Average HMDB51, UCF101, Kinetics-600, EPIC-Kitchen
39.7FPR
15
Average Multi-domain
10,572Thinking Tokens Count
15
Average Mixed Queries
7.15Match Rate (MAT)
15
Average (AVG)
90.3Accuracy
15
Average All 19 Datasets
72.45Average ROC-AUC
15
Average (DTB70, UAVDT, UAV123)
83.7AP
15
Average across datasets
91.9Precision
15
Average (MuSiQue, HotpotQA, 2WikiMQA, Bamboogle)
55.34F1 Score
15
Average Across all Benchmarks
0.8Delta Accuracy
15
Average Low-resolution Datasets
34.3PSNR
15
Average 7 QA benchmarks
40.54EM
14
Average AIME24, AIME25, AMC23, MATH500, APEX
48.9Pass@1
14
Average GSM8K, MATH-500, AMC23
83.9Accuracy
14
Average Reasoning Benchmarks
40.91Avg@8
14
Average MBO, NHO, SPO, TMC
14.6Avg APD
14
Average (GSM8K, MATH-500, AMC23, AIME24, AIME25)
69.9Accuracy
14
Average 7 datasets
0.969Delta 1 Acc
14
Average (NQ, TriviaQA, HotpotQA, StrategyQA, 2WikiMHQA)
55Average Score
14
Average Out-of-Domain
75.54Macro F1
14
Average In-Domain
78.58Macro F1
14