Video-to-Text Retrieval on CapERA
15R@1TCMA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TCMABackbone=ViT-B/162025.10 | 15 | 39.3 | 53.5 | 9 | 26.2 | |
| TCMABackbone=ViT-B/322025.10 | 12.7 | 34.6 | 49.6 | 11 | 31.9 | |
| TempMeBackbone=ViT-B/162025.10 | 11.9 | 36.4 | 52.2 | 10 | 22.3 | |
| UniAdapterBackbone=ViT-B/322025.10 | 11 | 34.2 | 48.7 | 11 | 26.6 | |
| TempMeBackbone=ViT-B/322025.10 | 11 | 32.2 | 46.3 | 12 | 28.1 | |
| TS2-NetBackbone=ViT-B/162025.10 | 10.8 | 35.3 | 51.4 | 10 | 24.6 | |
| EERCFBackbone=ViT-B/162025.10 | 10.7 | 36.1 | 50.8 | 10 | 25.3 | |
| EERCFBackbone=ViT-B/322025.10 | 10.5 | 32.2 | 47 | 12 | 29.6 | |
| UCoFiABackbone=ViT-B/162025.10 | 9.9 | 32.1 | 47.2 | 12 | 28.7 | |
| UATVRBackbone=ViT-B/162025.10 | 9.9 | 32.4 | 48.7 | 11 | 25.4 | |
| TS2-NetBackbone=ViT-B/322025.10 | 9.7 | 31 | 46.4 | 12 | 29 | |
| UCoFiABackbone=ViT-B/322025.10 | 8.5 | 29 | 42.3 | 14 | 33.3 | |
| UATVRBackbone=ViT-B/322025.10 | 8.2 | 27.3 | 42.4 | 15 | 35.2 | |
| CLIPBackbone=ViT-B/322025.10 | 4.6 | 18.6 | 32 | 21 | 43.8 | |
| CLIPBackbone=ViT-B/162025.10 | 4.5 | 18.8 | 32.6 | 21 | 41.6 |