Video-to-Text Retrieval on DVTMD
45.9R@1TCMA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TCMABackbone=ViT-B/162025.10 | 45.9 | 74.3 | 85.3 | 2 | 6.4 | |
| TCMABackbone=ViT-B/322025.10 | 42.8 | 71.2 | 83.4 | 2 | 8 | |
| EERCFBackbone=ViT-B/162025.10 | 41.8 | 73.8 | 84.4 | 2 | 7.1 | |
| TS2-NetBackbone=ViT-B/162025.10 | 41 | 72.4 | 84.9 | 2 | 6.8 | |
| UniAdapterBackbone=ViT-B/322025.10 | 41 | 71.7 | 82.9 | 2 | 7 | |
| UCoFiABackbone=ViT-B/162025.10 | 40.5 | 72.9 | 83.8 | 2 | 8.1 | |
| EERCFBackbone=ViT-B/322025.10 | 40 | 69.9 | 82.6 | 2 | 8.4 | |
| TempMeBackbone=ViT-B/162025.10 | 38.7 | 68.3 | 81.3 | 2 | 8.2 | |
| TS2-NetBackbone=ViT-B/322025.10 | 38.5 | 69.7 | 81.2 | 2 | 8.4 | |
| UCoFiABackbone=ViT-B/322025.10 | 37.2 | 68.7 | 80.9 | 2 | 9.8 | |
| TempMeBackbone=ViT-B/322025.10 | 37.1 | 66.3 | 77.9 | 3 | 9.8 | |
| UATVRBackbone=ViT-B/162025.10 | 36.7 | 70.1 | 81.4 | 2 | 7.8 | |
| UATVRBackbone=ViT-B/322025.10 | 34.2 | 66.4 | 79 | 3 | 9.6 | |
| CLIPBackbone=ViT-B/162025.10 | 30.8 | 64.3 | 78.2 | 3 | 8.3 | |
| CLIPBackbone=ViT-B/322025.10 | 28.5 | 60.4 | 74.9 | 4 | 10 |