Average
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Average GSM, GSM-Hard, SVAMP, MultiArith
79.15Pass@1
13
Average (AC-Real-TSR, MiniWob++, AndroidWorld)
38.7Success Rate (SR)
13
Average V* HR-Bench POPE
84.26Accuracy
13
Average GSM8K, HumanEval, ARC-c
60.77Accuracy
13
Average Rain, Low-light, Snow, Haze, Blur
32.61PSNR
13
Average (AMC23, ARC-C, GPQA, GSM8K)
4Delta Accuracy
13
Average (P'_1, P'_2, P'_3)
0.202FPR@95
13
Average (Celeb-DF, Wild Deepfake, DFDC-P, DFD, DiffSwap)
83.78AUC
13
Average
85.48Base Score
13
Average (In-distribution)
69.28Accuracy
12
Average AIME24, AIME25, AIME26, GPQA-D
10,230Think Tokens
12
Average QASPER, Contract-NLI, FinQA, PrivacyQA, CUAD, MAUD
94Recall
12
Average (test)
51.3EM
12
Average AIME25 AIME24 GPQA-Diamond
74.32Accuracy
12
Average (AIME, AIME25, AMC, HMMT25)
51.1Pass@1
12
Average 8 datasets
93.57Average Accuracy
12
Average (NQ, PopQA, MuSiQue, 2Wiki, HotpotQA, MultiHop-RAG)
37.1EM
12
Average all benchmarks
0.31MSE
12
Average (GSM8K, MATH500, AIME24, OlymBench)
64Accuracy
12
Average (ImageNet, iNat21, CUB, Cars)
69.7Average Top-1 Acc
12
Average BIOC-GS GSC-2024 ID-68
79.79Average F1 Score
12
Average across diffusion-based generators
94.8Accuracy
12
Average (11 datasets) Base classes
86.11Accuracy
12
Average GSM8K, MATH500, AMC23, AIME25
72.5Accuracy
12
Average 14 datasets
71.7Accuracy
12