Audio-to-image retrieval on Places 400k
53.4R@1MILAN
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MILANInput Modality=Visual, Audio, Pretrain Datasets=CSC†2022.09 | 53.4 | 79.1 | 86.3 | |
| TVLTInput Modality=Visual, Audio, Pretrain Datasets=YTT-S2022.09 | 49 | 78.2 | 86.8 | |
| TVLTInput Modality=Visual, Audio, Pretrain Datasets=HT100M2022.09 | 48.7 | 77.9 | 86 | |
| AVLnetInput Modality=Visual, Audio, Pretrain Datasets=HT100M2022.09 | 44.8 | 76.9 | 86.4 |