Text-to-Video Retrieval on DiDeMo CLIP-based (test)
48.4R@1DiscoVLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DiscoVLA# Params (M)=0.56, Backbone=CLIP ViT-B/322025.06 | 48.4 | 74.5 | 82.7 | 205.6 | 14 | |
| VoPF+C# Params (M)=14.10, Backbone=CLIP ViT-B/322025.06 | 46.4 | 71.9 | 81.5 | 199.8 | 13.6 | |
| VoPF+P# Params (M)=0.4, Backbone=CLIP ViT-B/322025.06 | 45.3 | 72.3 | 80.4 | 198 | 13.8 | |
| Full fine-tuning# Params (M)=123.54, Backbone=CLIP ViT-B/322025.06 | 43.4 | 70.2 | 80.6 | 194.2 | 17.5 | |
| RAP# Params (M)=1.06, Backbone=CLIP ViT-B/322025.06 | 42.6 | 70.4 | 79.6 | 192.6 | 18 |