ResearchBenchmarksImage-to-Text Retrieval on Places audio caption dataset ASR Text (held out)Follow22R@1SIMA10.14413.22216.319.378Apr 4, 2018Evaluation ResultsMethodMethodLinksR@1R@5R@10SIMAImageNet pre-trained=trueImageNet pre-trained=true2018.042249.459.9MISAImageNet pre-trained=trueImageNet pre-trained=true2018.0418.348.962.2SISAImageNet pre-trained=trueImageNet pre-trained=true2018.0417.446.261.1SIMAImageNet pre-trained=f...ImageNet pre-trained=false2018.0414.533.645.9MISAImageNet pre-trained=f...ImageNet pre-trained=false2018.0411.330.944.7SISAImageNet pre-trained=f...ImageNet pre-trained=false2018.0410.630.943