ResearchDatasetsVision, Language, and Multi-modal tasksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsModel MergingVision, Language, and Multi-modal tasks8Parameters11