Visual-to-Audio Retrieval on MSR-VTT (test)
260R@1CAV-MAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CAV-MAEλ_c=0.1, Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 260 | 920 | 1,310 | |
| CAVλ=0.1, Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 190 | 960 | 1,490 | |
| Boggust et al. (2019)Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 180 | 450 | 810 | |
| AVLnetTraining=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 80 | 460 | 810 | |
| Arandjelovic & Zisserman (2018)Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 30 | 250 | 660 | |
| AVLnetPretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 17.2 | 26.6 | 46.6 | |
| CAV-MAEScale+Pretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 13.3 | 29 | 40.5 | |
| Arandjelovic & ZissermanPretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 11.9 | 25.9 | 34.7 | |
| CAVPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.12022.10 | 10.5 | 25.2 | 35.5 | |
| CAV-MAEPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.12022.10 | 10 | 26.5 | 38 | |
| Random2022.10 | 10 | 50 | 100 | |
| Boggust et al.Pretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 9.3 | 20.7 | 28.8 | |
| CAV-MAEPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 8.3 | 23.5 | 35 | |
| CAVPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 6.9 | 22.5 | 33.1 |