Video-to-Text Retrieval on DiDeMo CLIP-based (test)
47.7R@1DiscoVLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DiscoVLA# Params (M)=0.56, Backbone=CLIP ViT-B/322025.06 | 47.7 | 74.4 | 83.8 | 205.9 | 9.3 | |
| VoPF+P# Params (M)=0.4, Backbone=CLIP ViT-B/322025.06 | 44.7 | 71.2 | 81.1 | 197 | 9.9 | |
| VoPF+C# Params (M)=14.10, Backbone=CLIP ViT-B/322025.06 | 44.4 | 71.8 | 81.8 | 198 | 9.5 | |
| Full fine-tuning# Params (M)=123.54, Backbone=CLIP ViT-B/322025.06 | 42.5 | 70.6 | 80.2 | 193.3 | 11.6 |