Text-to-Video Retrieval on MSRVTT (1k-B)
20.3Recall@1Multi-modal Transformer
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Multi-modal TransformerPre-training=false2020.07 | 20.3 | 49.1 | 63.9 | 6 | 29.5 | |
| CE2020.07 | 18.2 | 46 | 60.7 | 7 | 35.3 | |
| JPose2020.07 | 14.3 | 38.1 | 53 | 9 | — | |
| MEE-COCOPre-training=COCO2020.07 | 14.2 | 39.2 | 53.8 | 9 | — | |
| MEE2020.07 | 13.6 | 37.9 | 51 | 10 | — | |
| Random baseline2020.07 | 0.1 | 0.5 | 1 | 500 | 500 |