Combined
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Combined Past Tense, OR-Bench, MMLU
78.9R-Score
36
Combined 37 Tasks (test)
72.4Accuracy
28
Combined 107 Tasks (train)
68.8Accuracy
28
Combined 7 Datasets
45Average Score
18
Combined Average
90.18F1 Score (Combined Average)
17
Combined NQ, TriviaQA, PopQA, HotpotQA, 2WikiMQA, MuSiQue, Bamboogle
280.3Total Score
15
Combined (Deraining, Desnowing, Dehazing)
34.02PSNR
13
Combined (ADFTD, BrainLat, AD-Auditory, ADFSU, APAVA)
78.23Accuracy
12
Combined ADFTD, BrainLat, AD-Auditory, ADFSU, APAVA
68.03Accuracy
12
Combined (test)
3.925RMSE
12
Combined (VideoMME, LVBench, LongVideoBench, EgoSchema, MLVU)
64.9Average Score
11
Combined LCtx, ALFWorld, ScienceWorld, Web/Tool
78.9Mean Task Success
10
Combined LLM-generated + COCO-derived
85.25Suppression Rate
10
Combined LMSYS, SafeDialBench, Synthetic (held-out)
99Detection Accuracy
10
Combined All Datasets (test)
4.5ASR
6
Combined General AI Assistant, WebWalkerQA, BrowseComp, XBench
11.8Overall Score
5
Combined (GSM8k, MATH500, MAWPS, SVAMP, AQuA, GLUE, CSQA, OBQA)
72.94Average Score
5
Combined 20K labeled samples
0.076Brier Score
5
Combined (label-stratified)
0.986AUROC
4
Combined Zero-shot
63.71Average Accuracy
4
Combined (C)
100Compilation Success Rate
4
Combined Synthetic (evaluation set)
84AUROC
3
Combined 4 datasets
99.5Accuracy
3
Combined
8.05FE
3
Combined Dataset
0.55Testing Time (hours)
3