Audio-to-Text Retrieval (via Vision pivot) on AVE to MSRVTT (test)
35.3mAPIB+BB
Evaluation Results
| Method | Links | |
|---|---|---|
| IB+BBBackbone=ImageBind, Variant=BrokenBind2026.02 | 35.3 | |
| LB+BBBackbone=LanguageBind, Variant=BrokenBind2026.02 | 32.5 | |
| LB+FTBackbone=LanguageBind, Variant=Fine-tuned2026.02 | 15.3 | |
| LBBackbone=LanguageBind, Variant=Zero-shot2026.02 | 13.4 | |
| IB+FTBackbone=ImageBind, Variant=Fine-tuned2026.02 | 12.4 | |
| IBBackbone=ImageBind, Variant=Zero-shot2026.02 | 11.4 |