ResearchDatasetsUnweighted AverageFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsLarge Vision-Language Model EvaluationUnweighted Average9.8ECE29