Text-to-Video Retrieval on MSRVTT 9k
44.8R@1ViFi-Clip
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ViFi-ClipBackbone=ViT-B/16, Number of Frames=162022.12 | 44.8 | 72.4 | — | — | — | |
| All-in-one + MELTRbase_model=All-in-one2023.03 | 41.3 | 73.5 | 82.5 | — | — | |
| All-in-one2023.03 | 37.9 | 68.1 | 77.1 | — | — | |
| A5Backbone=ViT-B/16, Number of Frames=162022.12 | 36.7 | 64.6 | — | — | — | |
| Violet + MELTRbase_model=Violet2023.03 | 35.5 | 67.2 | 78.4 | 3 | — | |
| Violet2023.03 | 34.5 | 63 | 73.4 | — | — | |
| Frozen2023.03 | 32.5 | 61.5 | 71.2 | 3 | — | |
| UniVL + MELTRbase_model=UniVL2023.03 | 31.1 | 55.7 | 68.3 | 4 | — | |
| FrozenBackbone=ViT-B/16, Number of Frames=162022.12 | 31 | 59.5 | — | — | — | |
| VideoCLIP2023.03 | 30.9 | 55.4 | 66.8 | — | — | |
| T2VLAD2023.03 | 29.5 | 59 | 70.1 | 4 | — | |
| TACO2023.03 | 28.4 | 57.8 | 71.2 | 4 | — | |
| UniVL-Joint2023.03 | 27.2 | 55.7 | 68.7 | 4 | — | |
| MMT2023.03 | 26.6 | 57.1 | 69.6 | 4 | — | |
| AVIGATEAudio=AST, Speech=✗, Video embedding network=Bi-branch, Early vision-audio alignment=✗2026.03 | — | — | — | — | 207.7 | |
| EclipSEAudio=ResNet-18, Speech=✗, Video embedding network=Bi-branch, Early vision-audio alignment=✗2026.03 | — | — | — | — | 197.8 | |
| SAVEAudio=AST, Speech=ASR + CLIP, Video embedding network=Tri-branch, Early vision-audio alignment=✓2026.03 | — | — | — | — | 216.2 | |
| TEFALAudio=AST, Speech=✗, Video embedding network=Bi-branch, Early vision-audio alignment=✗2026.03 | — | — | — | — | 209.2 |