Text-to-Video Retrieval on DVTMD 1.0 (test)
48.5R@1TCMA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| TCMABackbone=ViT-B/162025.10 | 48.5 | 77.4 | 86.5 | 2 | 9.4 | |
| UCoFiABackbone=ViT-B/16, Venue=ICCV’232025.10 | 46.9 | 74.6 | 85.2 | 2 | 11.4 | |
| EERCFBackbone=ViT-B/16, Venue=AAAI’242025.10 | 46.4 | 76.8 | 86.3 | 2 | 11.6 | |
| TCMABackbone=ViT-B/322025.10 | 45.5 | 75.3 | 84.6 | 2 | 10.2 | |
| TS2-NetBackbone=ViT-B/16, Venue=ECCV’222025.10 | 44.4 | 76.3 | 85.4 | 2 | 9.5 | |
| EERCFBackbone=ViT-B/32, Venue=AAAI’242025.10 | 44.3 | 74.8 | 84.1 | 2 | 11 | |
| Clip4clipBackbone=ViT-B/16, Venue=NeuroCom’212025.10 | 44.2 | 75.5 | 84.9 | 2 | 8.7 | |
| TS2-NetBackbone=ViT-B/32, Venue=ECCV’222025.10 | 42.6 | 72.3 | 82.2 | 2 | 10.9 | |
| UCoFiABackbone=ViT-B/32, Venue=ICCV’232025.10 | 42.3 | 70.2 | 81.2 | 2 | 11.8 | |
| UATVRBackbone=ViT-B/16, Venue=ICCV’232025.10 | 41.4 | 73.1 | 82.7 | 2 | 11.5 | |
| Clip4clipBackbone=ViT-B/32, Venue=NeuroCom’212025.10 | 41.3 | 72.3 | 82.5 | 2 | 9.7 | |
| UniAdapterBackbone=ViT-B/32, Venue=ICLR’242025.10 | 41.1 | 72.8 | 83 | 2 | 9.3 | |
| TempMeBackbone=ViT-B/16, Venue=ICLR’252025.10 | 40.4 | 73.2 | 82.7 | 2 | 11.9 | |
| XpoolBackbone=ViT-B/32, Venue=CVPR’222025.10 | 39 | 69.6 | 80.5 | 2 | 11.8 | |
| UATVRBackbone=ViT-B/32, Venue=ICCV’232025.10 | 38.4 | 69.4 | 79.8 | 2 | 12.8 | |
| TempMeBackbone=ViT-B/32, Venue=ICLR’252025.10 | 37.5 | 67.5 | 79.5 | 2 | 13.9 | |
| DiffusionRetBackbone=ViT-B/16, Venue=ICCV’232025.10 | 36.7 | 61.8 | 72.3 | 3 | 58.4 | |
| DiffusionRetBackbone=ViT-B/32, Venue=ICCV’232025.10 | 33.3 | 58.5 | 68.2 | 3 | 60.4 | |
| CLIPBackbone=ViT-B/16, Venue=ICML’212025.10 | 29.6 | 57.9 | 70.6 | 4 | 20 | |
| CLIPBackbone=ViT-B/32, Venue=ICML’212025.10 | 26 | 54.2 | 67.3 | 4 | 23.7 |