Audio-to-Visual Retrieval on MSR-VTT (test)
150R@1CAV-MAE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CAV-MAEλ_c=0.1, Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 150 | 800 | 1,240 | |
| Arandjelovic & Zisserman (2018)Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 130 | 430 | 820 | |
| Boggust et al. (2019)Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 100 | 380 | 710 | |
| AVLnetTraining=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 90 | 500 | 900 | |
| MAVILPT data=HT-100M2022.12 | 23.8 | — | — | |
| MAVILPT data=AS-2M2022.12 | 22.8 | — | — | |
| TVLTPT data=HT100M2022.12 | 22.6 | — | — | |
| AVLNetPT data=HT100M2022.12 | 20.1 | — | — | |
| CAVλ=0.1, Training=only MSR-VTT data, Initialization=ImageNet weights2022.10 | 20 | 480 | 1,040 | |
| AVLnetPretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 17.8 | 35.5 | 43.6 | |
| Arandjelovic & ZissermanPretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 12.6 | 26.3 | 33.7 | |
| Random2022.10 | 10 | 50 | 100 | |
| Boggust et al.Pretrain Dataset=HowTo100M, Zero-shot=true2022.10 | 7.6 | 21.1 | 28.3 | |
| CAV-MAEScale+Pretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 7.6 | 19.8 | 30.2 | |
| CAV-MAEPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.12022.10 | 7 | 18.7 | 28.6 | |
| CAVPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.12022.10 | 6.2 | 17.9 | 26.1 | |
| CAV-MAEPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 4.9 | 14.6 | 21.9 | |
| CAVPretrain Dataset=AudioSet-2M, Zero-shot=true, lambda_c=0.012022.10 | 4.2 | 14.8 | 22.7 |