Text-to-Video Retrieval on MSR-VTT 1k-Yu (test)
32.4R@1Dual Encoding
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Dual EncodingFeatures=Transformer features included2020.09 | 32.4 | 62.3 | 72.8 | 3 | 46 | — | |
| MMTPre-training=None2020.09 | 24.6 | 54 | 67.1 | 4 | — | — | |
| HGRSource=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 21.7 | 47.4 | 61.1 | 6 | 34 | 259.1 | |
| Dual EncodingSource=Proposed, Visual Feature=ResNeXt-ResNet2020.09 | 21.1 | 48.7 | 60.2 | 6 | 33.6 | 262.7 | |
| Dual EncodingFeatures=Standard 2D CNN2020.09 | 21.1 | 48.7 | 60.2 | 6 | 33.6 | — | |
| CESource=Original Paper2020.09 | 20.9 | 48.8 | 62.4 | 6 | — | 267 | |
| W2VV++Source=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 19 | 45 | 58.7 | 7 | 31.8 | 236.9 | |
| TCESource=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 17.8 | 46 | 58.3 | 7 | 31.1 | 243.3 | |
| CESource=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 17.2 | 46.2 | 58.5 | 7 | 30.3 | 241.8 | |
| TCESource=Original Paper2020.09 | 16.1 | 38 | 51.5 | 10 | — | — | |
| VSE++Source=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 16 | 38.5 | 50.9 | 10 | 27.4 | 212.1 | |
| Dual EncodingFeatures=Transformer features only2020.09 | 15 | 40.7 | 54.2 | 8 | 27.6 | — | |
| Miech et al.Source=Original Paper2020.09 | 14.9 | 40.2 | 52.8 | 9 | — | — | |
| MEESource=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 14.6 | 38.4 | 52.4 | 9 | 26.1 | 215.3 | |
| JSFusionSource=Original Paper2020.09 | 10.2 | 31.2 | 43.2 | 13 | — | — | |
| ActBERTPre-training=HowTo100M2020.09 | 8.6 | 23.4 | 33.1 | 36 | — | — | |
| CT-SANSource=Original Paper2020.09 | 4.4 | 16.6 | 22.3 | 35 | — | — | |
| W2VVSource=Re-trained, Visual Feature=ResNeXt-ResNet2020.09 | 1.9 | 9.9 | 15.2 | 79 | 6.8 | 133.8 |