Video-to-Text Retrieval on MSR-VTT (1k-B)
58.5R@5RoME
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| RoMEVisual Backbone=Resnet-152 (ImageNet) + ResNeXt-101 (Kinetics), Batch Size=322022.06 | 58.5 | 27.9 | 73.1 | 4 | — | |
| Multi-modal Transformer2020.07 | 49.4 | — | — | 6 | 24.5 | |
| CETest-set=1k-B2019.07 | 46 | 18 | 60.3 | 6.5 | 30.6 | |
| CE2020.07 | 46 | — | — | 6.5 | 30.6 | |
| CEVisual Backbone=SENet-154 (ImageNet) + R(2+1)D (IG-65m) + Six more visual experts2022.06 | 46 | 18 | 60.3 | 6.5 | — | |
| JPose2020.07 | 41.3 | — | — | 8.7 | — | |
| JPoSEVisual Backbone=TSN + Flow2022.06 | 41.3 | 16.4 | 54.4 | 8.7 | — | |
| Random baseline2020.07 | 0.5 | — | — | 500 | 500 |