Overall
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Overall
44.6Recall@1
10
Overall Combined Benchmarks
58.4Avg@3 Score
10
Overall Average (test)
58.3EM
10
Overall
38.74Overall Score
9
Overall Mean
97.1Decoupling Probability
9
Overall 9 Benchmarks
88Average Score
9
Overall All environments
9.95Backward Transfer
8
Overall
5.808Average Score
8
Overall Summary across all suites
2.14Overall Average Rank
8
Overall 8 Modalities Average
16.53rFID (Avg)
8
Overall
93.51Accuracy
8
Overall (Musique, HotpotQA, NarrativeQA, DetectiveQA)
56.64Avg Recall@3
8
Overall Across All Benchmarks
563.56SUM
8
Overall
21Top-1 Count
8
Overall Mean
76.2Accuracy
7
Overall Unsolvable
0.945Accuracy
7
Overall Solvable
67.3Accuracy
7
Overall
97.4Solvable Accuracy
7
Overall (Globem, IFH Affect, Lifesnap, Pmdata) (test)
1.88Average Rank
6
Overall CovidQA, PubmedQA, FinanceBench
82.3F1 Score
6
Overall (18 languages)
61.91Accuracy
6
Overall Combined Datasets (test)
28.37PSNR
6
Overall Average
171.1Area
5
Overall All model pairs
99.4AUC
5
Overall
49.3Dice Score
5