Average
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Average 8 Benchmarks
74.4Average Score
19
Average (PACS, VLCS, OfficeHome, Digits-DG, Multi-Dataset, Mini-DomainNet)
94.23Acc
19
Average 11 datasets (Novel)
82.7Top-1 Accuracy (Avg)
19
Average Across Domains A-D (test)
71.77DICE
18
Average Overall
40.95SubEM
18
Average C16, C17-0, C17-1, C17-2, C17-3, C17-4
73.4Accuracy (CL Average)
18
Average C16, C17-0, C17-1, C17-2, C17-3, C17-4
44.1PxAP
18
Average across datasets
70.2Clean Accuracy
18
Average Zero-shot (15 datasets)
60.4Clean Accuracy
18
Average over 11 datasets
82.05Base Accuracy
18
Average (Do-Not-Answer, HarmBench, HH-RLHF, Salad Bench)
0.59Aggregate Score
18
Average
65Win Rate
18
Average 100K context
67.1Accuracy
18
Average 30K context
69.8Accuracy
18
Average All Datasets
89.4Accuracy
18
Average (Real20, Objects, Postcard, Wild) (test)
26.65PSNR
18
Average 4 Datasets
85.2Precision
17
Average DTB70, UAVDT, VisDrone2018, UAV123
85.5Precision
17
Average Math500, AIME25, AMC23
13,040Length
17
Average 6 downstream tasks
68.1Top-1 Accuracy
17
Average across 5 datasets
63.43Average Accuracy
16
Average In-domain Agieval MMLU
65.3Accuracy
16
Average (GSM8k, ViGGO, SQL) (val)
81.1Accuracy
16
Average
73.4Performance Score
16
Average All Benchmarks
0.862RMSE
16