Video-to-Text Retrieval on MSRVTT (1k-B)
21.1Recall@1Multi-modal Transformer
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Multi-modal TransformerPre-training=false2020.07 | 21.1 | 49.4 | 63.2 | 6 | 24.5 | |
| CE2020.07 | 18 | 46 | 60.3 | 6.5 | 30.6 | |
| JPose2020.07 | 16.4 | 41.3 | 54.4 | 8.7 | — | |
| Random baseline2020.07 | 0.1 | 0.5 | 1 | 500 | 500 |