Text-to-Video Retrieval on MSR-VTT 1K-A 9K (test)
46.9Recall@1X-Pool
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| X-Poolimage_encoder=CLIP ViT-B/32, text_encoder=CLIP Transformer Base2022.03 | 46.9 | 72.8 | 82.2 | 2 | 14.3 | |
| CLIP4Clippooling=seq Transf2022.03 | 44.5 | 71.4 | 81.6 | 2 | 15.3 | |
| CLIP4Clippooling=meanP2022.03 | 43.1 | 70.4 | 80.8 | 2 | 16.2 | |
| MDMMT2022.03 | 38.9 | 69 | 79.7 | 2 | 16.5 | |
| Straight-CLIP2022.03 | 31.2 | 53.7 | 64.2 | 4 | — | |
| Frozen2022.03 | 31 | 59.5 | 70.5 | 3 | — | |
| Support Set2022.03 | 30.1 | 58.5 | 69.3 | 3 | — | |
| TeachText-CE+2022.03 | 29.6 | 61.6 | 74.2 | 3 | — | |
| MMT2022.03 | 26.6 | 57.1 | 69.6 | 4 | 24 | |
| CE2022.03 | 20.9 | 48.8 | 62.4 | 6 | 28.2 |