Text-to-Audio Retrieval (via Vision pivot) on AVE to MSRVTT (test)
34.1mAPIB+BB
Evaluation Results
| Method | Links | |
|---|---|---|
| IB+BBBackbone=ImageBind, Variant=BrokenBind2026.02 | 34.1 | |
| LB+BBBackbone=LanguageBind, Variant=BrokenBind2026.02 | 33.4 | |
| IB+BBBackbone=ImageBind, Variant=BrokenBind2026.02 | 25.6 | |
| LB+BBBackbone=LanguageBind, Variant=BrokenBind2026.02 | 24.8 | |
| LB+FTBackbone=LanguageBind, Variant=Fine-tuned2026.02 | 14.1 | |
| IB+FTBackbone=ImageBind, Variant=Fine-tuned2026.02 | 11 | |
| LB+FTBackbone=LanguageBind, Variant=Fine-tuned2026.02 | 10.6 | |
| LBBackbone=LanguageBind, Variant=Zero-shot2026.02 | 10.1 | |
| IBBackbone=ImageBind, Variant=Zero-shot2026.02 | 9.2 | |
| LBBackbone=LanguageBind, Variant=Zero-shot2026.02 | 8.9 | |
| IB+FTBackbone=ImageBind, Variant=Fine-tuned2026.02 | 5.7 | |
| IBBackbone=ImageBind, Variant=Zero-shot2026.02 | 5.3 |