Text-to-Video Retrieval on MSR-VTT (1k-B)
50Recall@5RoME
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| RoMEVisual Backbone=Resnet-152 (ImageNet) + ResNeXt-101 (Kinetics), Batch Size=322022.06 | 50 | 21.1 | 63.1 | 5 | — | |
| Multi-modal Transformer2020.07 | 49.1 | — | — | 6 | 29.5 | |
| CETest-set=1k-B2019.07 | 46 | 18.2 | 60.7 | 7 | 35.3 | |
| CE2020.07 | 46 | — | — | 7 | 35.3 | |
| CEVisual Backbone=SENet-154 (ImageNet) + R(2+1)D (IG-65m) + Six more visual experts, Batch Size=-2022.06 | 46 | 18.2 | 60.7 | 7 | — | |
| TACoVisual Backbone=Resnet-152 (ImageNet) + ResNeXt-101 (Kinetics), Batch Size=1282022.06 | 44.7 | 19.2 | 57.2 | 7 | — | |
| MoEEcocoTest-set=1k-B2019.07 | 39.2 | 14.2 | 53.8 | 9 | — | |
| MEE-COCO2020.07 | 39.2 | — | — | 9 | — | |
| UniVL (v1*)Visual Backbone=Resnet-152 (ImageNet) + ResNeXt-101 (Kinetics), Batch Size=-2022.06 | 39 | 14.6 | 52.6 | 10 | — | |
| SwAMPVisual Backbone=Resnet-152 (ImageNet) + ResNeXt-101 (Kinetics), Batch Size=1282022.06 | 38.5 | 15 | 50.3 | 10 | — | |
| JPose2020.07 | 38.1 | — | — | 9 | — | |
| JPoSEVisual Backbone=TSN + Flow, Batch Size=-2022.06 | 38.1 | 14.3 | 53 | 9 | — | |
| MOEETest-set=1k-B2019.07 | 37.9 | 13.6 | 51 | 10 | — | |
| MEE2020.07 | 37.9 | — | — | 10 | — | |
| MoEEVisual Backbone=SENet-154 (ImageNet) + R(2+1)D (IG-65m) +, Batch Size=-2022.06 | 37.9 | 13.6 | 51 | 10 | — | |
| Random baseline2020.07 | 0.5 | — | — | 500 | 500 | |
| RandomVisual Backbone=-, Batch Size=-2022.06 | 0.5 | 0.1 | 1 | 500 | — |