Cross-modal retrieval on Clotho (test)
46.4R@1CART
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CART2024.06 | 46.4 | 70.6 | 76 | 52.3 | |
| OmniBindmultimodal query=true2024.10 | 31 | 54.3 | — | — | |
| OmniBind2024.10 | 30 | 52.7 | — | — | |
| ONE-PEACERetrieval Direction=Audio -> Text2023.05 | 27.1 | 52.3 | 65.4 | — | |
| LAION-CLAPRetrieval Direction=Audio -> Text2023.05 | 25.7 | 51.5 | 63.4 | — | |
| Laion-CLAPmultimodal query=true2024.10 | 23.6 | 46.6 | — | — | |
| ONE-PEACETraining Status=Pretrained2024.06 | 22.4 | 49 | 62.7 | — | |
| ONE-PEACERetrieval Direction=Text -> Audio2023.05 | 22.4 | 49 | 62.7 | — | |
| Laion-CLAP2024.10 | 21.7 | 45.3 | — | — | |
| CLAP-HTSATRetrieval Direction=Audio -> Text2023.05 | 20 | 44.9 | 58.7 | — | |
| HTSAT-BERT2024.06 | 19.7 | 45.7 | 59.4 | — | |
| LAION-CLAPRetrieval Direction=Text -> Audio2023.05 | 18.2 | 42.5 | 54.4 | — | |
| TAPRetrieval Direction=Audio -> Text2023.05 | 17.6 | 39.6 | 51.4 | — | |
| VALORVariant=B2024.06 | 17.5 | 42.7 | 55.3 | — | |
| CLAP-HTSATRetrieval Direction=Text -> Audio2023.05 | 16.7 | 41.1 | 54.1 | — | |
| LanguageBindModality=Audio2024.06 | 16.3 | 40.4 | 53.9 | 26.6 | |
| TAPRetrieval Direction=Text -> Audio2023.05 | 16.2 | 39.2 | 50.8 | — | |
| ML-ACTRetrieval Direction=Audio -> Text2023.05 | 16.2 | 37.6 | 50.2 | — | |
| CLAP-HTSAT2024.06 | 16.1 | 38.3 | 51.1 | — | |
| ML-ACTRetrieval Direction=Text -> Audio2023.05 | 14.4 | 36.6 | 49.9 | — | |
| AVRPretraining=VideoCC3M + AudioCaps2022.04 | 12.6 | — | 45.4 | — | |
| AVRPretraining=AudioCaps2022.04 | 11.4 | — | 43.4 | — | |
| SOTAPretraining=AudioCaps2022.04 | 9.6 | — | 40.1 | — | |
| AVRPretraining=VideoCC3M2022.04 | 8.4 | — | 38.6 | — | |
| AVRPretraining=None2022.04 | 7.8 | — | 35.4 | — | |
| MMTRetrieval Direction=Audio -> Text2023.05 | 7 | 22.7 | 34.6 | — | |
| SOTAPretraining=None2022.04 | 6.7 | — | 33.3 | — | |
| MMTRetrieval Direction=Text -> Audio2023.05 | 6.7 | 21.6 | 33.2 | — | |
| AVRPretraining=VideoCC3M, Zero-shot=true2022.04 | 3 | — | 17.5 | — |