Composed Video Retrieval on AV-Comp (test)
35.9Recall@1CoVA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CoVABackbone=CLIP-L, Audio Encoder=AST, Fusion Module=GFT+AVT, Training=Fine-tuned2026.01 | 35.9 | 73.7 | 86.4 | 6.2 | |
| LanguageBindBackbone=CLIP-L, Audio Encoder=AST, Fusion Module=GFT+AVT, Training=Fine-tuned2026.01 | 27.17 | 61.44 | 77.12 | 8.7 | |
| ImageBindBackbone=CLIP-L, Audio Encoder=AST, Fusion Module=GFT+AVT, Training=Fine-tuned2026.01 | 20.2 | 50.5 | 65.4 | 14.6 |