Video/Caption Retrieval on Cross-Dataset Mean (Vatex, ActivityNet, MSR-VTT, S-MiT)
33R@1S-MiT model
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| S-MiT modelTrained On=S-MiT2021.05 | 33 | 62.6 | 73.5 | 46.5 | |
| Vatex modelTrained On=Vatex2021.05 | 24.3 | 50.5 | 62.1 | 36.7 | |
| MSR-VTT modelTrained On=MSR-VTT2021.05 | 18.7 | 45.8 | 59 | 31.6 | |
| ActivityNet modelTrained On=ActivityNet2021.05 | 17.3 | 42.5 | 55.2 | 29.4 |