Text-to-Video Retrieval on MSRVTT (R@1, R@5, R@10, R@sum, MnR)
50.5R@1DiscoVLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DiscoVLABackbone=CLIP (ViT-B/16), # Params (M)=0.562025.06 | 50.5 | 75.6 | 83.8 | 209.9 | 12.1 | |
| TempMeBackbone=CLIP (ViT-B/16), # Params (M)=0.502025.06 | 49 | 74.4 | 83.3 | 206.7 | 11.9 | |
| DGLBackbone=CLIP (ViT-B/16), # Params (M)=0.832025.06 | 48.3 | 71.8 | 80.6 | 200.7 | 13.4 | |
| VoP F+CBackbone=CLIP (ViT-B/16), # Params (M)=14.102025.06 | 47.7 | 72.4 | 82.2 | 202.3 | 12 | |
| VoP F+PBackbone=CLIP (ViT-B/16), # Params (M)=0.42025.06 | 47.1 | 72.4 | 81.8 | 201.3 | 12.9 | |
| DiscoVLABackbone=CLIP (ViT-B/32), # Params (M)=0.562025.06 | 47 | 73 | 82.8 | 202.8 | 14.1 | |
| RAPBackbone=CLIP (ViT-B/16), # Params (M)=1.062025.06 | 46.5 | 73.9 | 82 | 202.4 | 12.1 | |
| TempMeBackbone=CLIP (ViT-B/32), # Params (M)=0.502025.06 | 46.1 | 71.8 | 80.7 | 198.6 | 14.8 | |
| MV-AdapterBackbone=CLIP (ViT-B/16), # Params (M)=3.62025.06 | 46 | 72 | 82.1 | 200.1 | — | |
| RAPBackbone=CLIP (ViT-B/32), # Params (M)=1.062025.06 | 44.8 | 71.4 | 81.5 | 197.7 | 14.4 | |
| VoP F+CBackbone=CLIP (ViT-B/32), # Params (M)=14.102025.06 | 44.7 | 70.5 | 79.2 | 194.4 | 16.2 | |
| DGLBackbone=CLIP (ViT-B/32), # Params (M)=0.832025.06 | 44.6 | 69.9 | 80.3 | 194.8 | 16.3 | |
| LORABackbone=CLIP (ViT-B/32), # Params (M)=0.492025.06 | 43.7 | 68.9 | 80.4 | 193 | 16 | |
| VoP F+PBackbone=CLIP (ViT-B/32), # Params (M)=0.42025.06 | 43.5 | 69.3 | 79.3 | 192.1 | 14.8 | |
| Full fine-tuningBackbone=CLIP (ViT-B/32), # Params (M)=123.542025.06 | 43.1 | 70.4 | 80.8 | 194.3 | 16.2 | |
| AdapterBackbone=CLIP (ViT-B/32), # Params (M)=0.262025.06 | 41.9 | 69.9 | 78.7 | 190.2 | 14.9 | |
| PromptBackbone=CLIP (ViT-B/32), # Params (M)=0.082025.06 | 40.4 | 66.3 | 77.3 | 184 | 16.7 |