ResearchDatasetsAVCapsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsAudio-Visual CaptioningAVCaps (test)57CIDEr11