Average
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Average (CLIVE, KonIQ10K, FLIVE, SPAQ, AGIQA3K, AGIQA1K, KADID10K)
89.1SRCC
5
Average
77.3Clean Accuracy
5
Average (VideoDetailCaption, MVBench, LongVideoBench, VideoMME)
4.07Average Accepted Length
5
Average (5 RAG Datasets)
76.3Faithfulness
5
Average Overall Order-8
43.8mAP
5
Average (Infinigen, Sintel, KITTI, TUM RGB-D)
0.16AbsRel
5
Average arXiv, SciGen, WikiHow
4.42Conciseness
5
Average PDDL domains Standard
66Tasks Solved
5
Average 25 datasets
67.5Accuracy
5
Average (Q16, MHSC, SC) calculated (test)
59.66ASR-25
5
Average (AIS, AliM, AMI, DH3, MSD, NSF, RAMC, VoxC)
12.48DER (%)
4
Average (CRAG, NQ, HotpotQA, MuSiQue)
36.8Truthfulness
4
Average All 6 Datasets
48.57Exact Match (EM)
4
Average TGIF, MSVD, MSRVTT
100Accuracy Retention (%)
4
Average
37.8Mean Score
4
Average 9 scene types
4.3%CR
4
Average aggregated (test)
22.4EER
4
Average CIFAR-10, CIFAR-100, Tiny-IN
86.1ASR
4
Average Hazy Scenes
20.79PSNR
4
Average AlpacaEval, Evol-Inst, UltraFeed
90.9Average Win Rate
4
Average DFD, UniFace, SDv15, FakeAVCeleb
78.17AUC (Frame-level)
4
Average (11 datasets) Base
83.19Top-1 Acc
4
Average 20 in-domain datasets (summary)
84.3Accuracy
4
Average CR, MR, MPQA, SUBJ, TREC, SST-5
68.1Macro F1 Score
4
Average Across Seven Benchmarks
35.7Pass@1
3