Average
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Average (SNLI, AGNews, Yelp, Yahoo)
0.005Average MSE
22
Average Original
100AUC
22
Average Across all subsets
77.3AUROC
22
Average Zero-shot (8 datasets)
71.48Clean Accuracy Avg
22
Average across all datasets
0.946PLCC
22
Average
75.2Accuracy
22
Average (MATH500, AIME24, AIME25, GPQA_diamond)
58.71Accuracy
22
Average (15 datasets)
91Accuracy
22
Average OmniDocBench CC-OCR OCRBench V2 TableVerse-5K
88.79TEDS
21
Average Reasoning Benchmarks
45.3Pass@1
21
Average (CIFAR-10, CIFAR-100, ImageNet-200)
89.32AUROC
21
Average 10 Benchmarks
70.04Average Score
21
Average across 10 datasets
74.4Average Accuracy
21
Average
27.73PSNR
21
Average AIME25, AMC23, MATH500
67.59Mean@32
20
Average (CoQA, SQuAD v2.0, TriviaQA, TruthfulQA)
92AUROC
20
Average (MATH500, OlympiadBench, Minerva, MMLU, GSM8K)
70Average Accuracy
20
Average (METRLA, PEMSD4, PEMSD7(M), PEMSD8, PEMSBAY)
3.67MAE
20
Average Across FB Bench, FLASK, Vic. Bench, MT Bench
71Pearson (r)
20
Average Across all benchmarks
63.1Pass@1
20
Average Set5, Set14, BSDS100, Urban100, Manga109 x4 (test)
29.49PSNR
20
Average 9 datasets (test)
81.97Accuracy
19
Average (MuSiQue, 2Wiki, HotpotQA)
79.3R@2
19
Average 10 Tasks
100.6Average Accuracy
19
Average 10K context
74.6Accuracy
19