Image-to-Speech Retrieval on Places Audio Caption Dataset 1,000 image/caption (held out)
13.9R@1SIMA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SIMAImageNet pre-trained=true2018.04 | 13.9 | 36.7 | 48.3 | |
| [43]ImageNet pre-trained=true2018.04 | 13 | 37.8 | 54.2 | |
| MISAImageNet pre-trained=true2018.04 | 12.7 | 37.5 | 52.8 | |
| [19]ImageNet pre-trained=true2018.04 | 12.1 | 33.5 | 46.3 | |
| SISAImageNet pre-trained=true2018.04 | 12 | 36.3 | 50.6 | |
| SIMAImageNet pre-trained=false2018.04 | 6.5 | 16.8 | 25.5 | |
| MISAImageNet pre-trained=false2018.04 | 5.7 | 19.1 | 29.1 | |
| SISAImageNet pre-trained=false2018.04 | 4.8 | 16.6 | 24.9 |