Text-to-Audio Retrieval on MSRVTT
37.1AccuracyBrokenBind
Evaluation Results
| Method | Links | |
|---|---|---|
| BrokenBindBackbone=VCLIP+CLAP, Evaluation Protocol=BrokenBind, Source Dataset=AVE2026.02 | 37.1 | |
| VCLIP+CLAP+FTBackbone=VCLIP+CLAP, Evaluation Protocol=Fine-tuning, Source Dataset=AVE2026.02 | 15.4 | |
| VCLIP+CLAPBackbone=VCLIP+CLAP, Evaluation Protocol=Zero-shot, Source Dataset=AVE2026.02 | 13.6 |