Speech-to-Image Retrieval on Places audio caption dataset 1,000 image/caption (held out)
0.271R@1MISA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MISAImageNet pre-trained=true2018.04 | 0.271 | 0.567 | 0.701 | |
| SISAImageNet pre-trained=true2018.04 | 0.23 | 0.525 | 0.665 | |
| SIMAImageNet pre-trained=true2018.04 | 0.215 | 0.518 | 0.639 | |
| MISAImageNet pre-trained=true2018.04 | 0.2 | 0.469 | 0.604 | |
| SISAImageNet pre-trained=true2018.04 | 0.165 | 0.431 | 0.559 | |
| MISAImageNet pre-trained=false2018.04 | 0.162 | 0.417 | 0.547 | |
| [43]ImageNet pre-trained=true2018.04 | 0.161 | 0.404 | 0.564 | |
| [19]ImageNet pre-trained=true2018.04 | 0.148 | 0.403 | 0.548 | |
| SIMAImageNet pre-trained=true2018.04 | 0.147 | 0.375 | 0.506 | |
| SISAImageNet pre-trained=false2018.04 | 0.136 | 0.365 | 0.503 | |
| SIMAImageNet pre-trained=false2018.04 | 0.134 | 0.389 | 0.513 | |
| MISAImageNet pre-trained=false2018.04 | 0.079 | 0.225 | 0.314 | |
| SIMAImageNet pre-trained=false2018.04 | 0.073 | 0.213 | 0.284 | |
| SISAImageNet pre-trained=false2018.04 | 0.063 | 0.191 | 0.274 |