Cross-modal Retrieval (Audio) on MSR-VTT
42R@1Aligned
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AlignedSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 42 | 53.6 | |
| AlignedSetting=Unsupervised, IM Perceptor=LanguageBind2025.12 | 42 | 53.6 | |
| AlignedSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 35.5 | 51.5 | |
| AlignedSetting=Unsupervised, IM Perceptor=ImageBind2025.12 | 35.5 | 51.5 | |
| COXSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 25.2 | 36 | |
| COXSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 23.3 | 35.8 | |
| MoCoSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 21.1 | 34.8 | |
| MoCoSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 20.5 | 33.9 | |
| EntMinSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 19.6 | 33.4 | |
| EntMinSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 18.5 | 32.4 | |
| ERMSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 16.3 | 31.1 | |
| ERMSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 15.6 | 30.3 | |
| COXSetting=Unsupervised, IM Perceptor=LanguageBind2025.12 | 14.8 | 31.1 | |
| COXSetting=Unsupervised, IM Perceptor=ImageBind2025.12 | 13.5 | 30.4 | |
| MoCoSetting=Unsupervised, IM Perceptor=LanguageBind2025.12 | 9.6 | 29.4 | |
| MoCoSetting=Unsupervised, IM Perceptor=ImageBind2025.12 | 9.2 | 28.9 | |
| SSLSetting=Unsupervised, IM Perceptor=LanguageBind2025.12 | 9.2 | 28.9 | |
| SSLSetting=Unsupervised, IM Perceptor=ImageBind2025.12 | 8.9 | 28.4 | |
| RandomSetting=Semi-Supervised, IM Perceptor=ImageBind2025.12 | 5.4 | 25.1 | |
| RandomSetting=Unsupervised, IM Perceptor=ImageBind2025.12 | 5.4 | 25.1 | |
| RandomSetting=Semi-Supervised, IM Perceptor=LanguageBind2025.12 | 5.2 | 24.3 | |
| RandomSetting=Unsupervised, IM Perceptor=LanguageBind2025.12 | 5.2 | 24.3 |