Overall
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Overall
50.7Accuracy
5
Overall
0.64Kendall's Tau
5
Overall
0.56Kendall's Tau
5
Overall
0.48Kendall's Tau
5
Overall
77.3Precision
4
Overall
81Precision
4
Overall (VOC, COCO, LVIS, BDD)
1,207,742Total Labels
4
Overall
32.4Rule-based Score
4
Overall Combined DS-I, DS-II, DS-III, DS-IV
98GSR
4
Overall MMLU GSM8K Moral Reasoning Profundity (test)
88.2Observed Praise Rate
4
Overall
100Compile Success Rate
4
Overall Aggregate
90.1Accuracy
4
Overall
22.12PSNR
4
Overall pooled micro average
0.741AUC
4
Overall Combined Tasks
99Token Cost (k)
4
Overall Across Datasets (aggregate)
0Complete Failure Proportion
4
Overall
28.181CLIP Score
4
Overall Across four sources
41.86Human Preference Rate
4
Overall
20Success Rate
3
Overall Across All Directions
82.94COMET Score
3
Overall
87.69Precision
3
Overall Across all datasets
78Accuracy
3
Overall
72.9Adjusted AP
3
Overall 940 total scenarios
95.8Pairwise Accuracy
2
Overall 1-shot
17.7ROM
2