Text-to-Video Retrieval on CapERA 1.0 (test)
16.5R@1Clip4clip
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Clip4clipBackbone=ViT-B/16, Venue=NeuroCom’212025.10 | 16.5 | 44.1 | 60.5 | 7 | 22 | |
| EERCFBackbone=ViT-B/16, Venue=AAAI’242025.10 | 16.5 | 43.1 | 58.7 | 7 | 24 | |
| TempMeBackbone=ViT-B/16, Venue=ICLR’252025.10 | 16.5 | 44.9 | 59.4 | 7 | 21.5 | |
| TCMABackbone=ViT-B/162025.10 | 16.1 | 44.6 | 61.2 | 7 | 21.2 | |
| UniAdapterBackbone=ViT-B/32, Venue=ICLR’242025.10 | 15.7 | 40.4 | 56.6 | 8 | 25.7 | |
| UCoFiABackbone=ViT-B/16, Venue=ICCV’232025.10 | 15.2 | 41.4 | 57 | 8 | 27.2 | |
| Clip4clipBackbone=ViT-B/32, Venue=NeuroCom’212025.10 | 15 | 39.5 | 55.7 | 9 | 26.9 | |
| TCMABackbone=ViT-B/322025.10 | 14.9 | 41.9 | 57.8 | 8 | 25.6 | |
| EERCFBackbone=ViT-B/32, Venue=AAAI’242025.10 | 14.8 | 41.6 | 57.7 | 8 | 27.9 | |
| TS2-NetBackbone=ViT-B/16, Venue=ECCV’222025.10 | 14.7 | 42.2 | 58.7 | 8 | 22.7 | |
| XpoolBackbone=ViT-B/32, Venue=CVPR’222025.10 | 14.5 | 38.4 | 54.6 | 9 | 24.9 | |
| UATVRBackbone=ViT-B/16, Venue=ICCV’232025.10 | 14.1 | 39.3 | 55.9 | 8 | 24.6 | |
| TS2-NetBackbone=ViT-B/32, Venue=ECCV’222025.10 | 13.8 | 40.5 | 55.3 | 8 | 28 | |
| UCoFiABackbone=ViT-B/32, Venue=ICCV’232025.10 | 13.8 | 38.4 | 53.1 | 9 | 29.7 | |
| DiffusionRetBackbone=ViT-B/16, Venue=ICCV’232025.10 | 13.6 | 35.4 | 48.8 | 11 | 54 | |
| TempMeBackbone=ViT-B/32, Venue=ICLR’252025.10 | 13.4 | 38.2 | 53.8 | 9 | 27.5 | |
| UATVRBackbone=ViT-B/32, Venue=ICCV’232025.10 | 11.9 | 34.2 | 48.6 | 11 | 31.8 | |
| DiffusionRetBackbone=ViT-B/32, Venue=ICCV’232025.10 | 11.7 | 32.4 | 45.8 | 13 | 63.5 | |
| CLIPBackbone=ViT-B/32, Venue=ICML’212025.10 | 8.8 | 24.7 | 36.8 | 19 | 52.1 | |
| CLIPBackbone=ViT-B/16, Venue=ICML’212025.10 | 8.8 | 26 | 38.1 | 18 | 48.1 |