Video-to-Text Retrieval on MSRVTT (1k-A)
27Recall@1Multi-modal Transformer
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Multi-modal TransformerPre-training=true2020.07 | 27 | 57.5 | 69.7 | 3.7 | 21.3 | |
| Multi-modal TransformerPre-training=false2020.07 | 24.4 | 56 | 67.8 | 4 | 23.6 | |
| CE2020.07 | 20.6 | 50.3 | 64 | 5.3 | 25.1 | |
| Random baseline2020.07 | 0.1 | 0.5 | 1 | 500 | 500 |