Places audio caption
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Places audio caption dataset 1,000 image/caption (held out)
0.271R@1
14
Places Audio Caption Dataset 1,000 image/caption (held out)
13.9R@1
8
Places audio caption dataset ASR Text (held out)
22R@1
6