Text-to-Video Retrieval on MSR-VTT (test)
990R@1MIL-NCE (S3D)
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MIL-NCE (S3D)Labeled dataset used=None, Backbone=S3D2019.12 | 990 | 2,400 | 3,240 | — | 29.5 | — | — | — | — | — | — | |
| MIL-NCE (I3D)Labeled dataset used=None, Backbone=I3D2019.12 | 940 | 2,220 | 3,000 | — | 35 | — | — | — | — | — | — | |
| Miech et al.Labeled dataset used=ImNet + K4002019.12 | 750 | 2,120 | 2,960 | — | 38 | — | — | — | — | — | — | |
| MemVerse2025.12 | 90.4 | 95.6 | 98.1 | — | — | — | — | — | — | — | — | |
| ExCaeBackbone=ViT-G/142025.12 | 67.7 | 92.7 | 96.2 | — | — | — | — | — | — | — | — | |
| VASTBackbone=ViT-G/142025.12 | 63.9 | 84.3 | 89.6 | — | — | — | — | — | — | — | — | |
| UMT-LBackbone=ViT-L/142025.12 | 58.8 | 81 | 87.1 | — | — | — | — | — | — | — | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/16, Post-processing=DSL2022.09 | 57.7 | 80.5 | 88.2 | — | — | 1 | — | — | — | — | — | |
| CLIP-VIPBackbone=ViT-B/162025.12 | 57.7 | 80.5 | 88.2 | — | — | — | — | — | — | — | — | |
| AGCCompression budget=322026.02 | 56.9 | — | — | — | — | — | — | — | 71.5 | 102.1 | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/32, Post-processing=DSL2022.09 | 55.9 | 77 | 86.8 | — | — | 1 | — | — | — | — | — | |
| InternVideo2_{s2}-6BInput Frame Number=8, zero-shot=true2024.03 | 55.9 | 78.3 | 85.1 | — | — | — | — | — | — | — | — | |
| InternVideo2_s2-6Bzero-shot=true2026.06 | 55.9 | 78.3 | 85.1 | — | — | — | — | — | — | — | — | |
| BaselineCompression budget=None2026.02 | 55.7 | — | — | — | — | — | — | — | 71.9 | 100 | — | |
| InternVideoBackbone=ViT-H/142025.12 | 55.2 | 79.6 | 87.5 | — | — | — | — | — | — | — | — | |
| InternVideo2_{s2}-6BInput Frame Number=4, zero-shot=true2024.03 | 54.5 | 77.5 | 83.7 | — | — | — | — | — | — | — | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/162022.09 | 54.2 | 77.2 | 84.8 | — | — | 1 | — | — | — | — | — | |
| MemTokCompression budget=322026.02 | 54.2 | — | — | — | — | — | — | — | 69.9 | 97.3 | — | |
| H-PoolCompression budget=322026.02 | 54.1 | — | — | — | — | — | — | — | 70.4 | 97.1 | — | |
| DRLBackbone=CLIP-ViT-B/16, Post-processing=QB-Norm2022.09 | 53.3 | 80.3 | 87.6 | — | — | 1 | — | — | — | — | — | |
| SeqResizeCompression budget=322026.02 | 53.3 | — | — | — | — | — | — | — | 69.9 | 95.7 | — | |
| mPLUG-2Backbone=ViT-L/142025.12 | 53.1 | 77.6 | 84.7 | — | — | — | — | — | — | — | — | |
| T-MASSBackbone=CLIP-ViT-B/16, Venue=CVPR'242025.03 | 52.7 | 77.1 | 85.6 | — | 1 | 10.5 | — | — | — | — | — | |
| NarVidBackbone=CLIP-ViT-B/162025.03 | 52.7 | 77.7 | 85.6 | — | 1 | 12.3 | — | — | — | — | — | |
| CART2024.06 | 52.6 | 75.4 | 84.2 | 61.8 | — | — | — | — | — | — | — | |
| VidVec-OModel Size=7B, Optimization Data=60K text-only in-context pairs2026.02 | 52.5 | 76.3 | 83.8 | — | — | — | — | — | — | — | — | |
| Cap4Video++Backbone=ViT-B/162025.12 | 52.3 | 76.8 | 85.8 | — | — | — | — | — | — | — | — | |
| VidVec-ZSModel Size=7B, Evaluation Protocol=Zero-shot, Reranking=K=1002026.02 | 52.1 | 74.3 | 82.9 | — | — | — | — | — | — | — | — | |
| InternVideo2_{s2}-1BInput Frame Number=4, zero-shot=true2024.03 | 51.9 | 74.6 | 81.7 | — | — | — | — | — | — | — | — | |
| InternVideo2_{s2}-1BInput Frame Number=8, zero-shot=true2024.03 | 51.9 | 75.3 | 82.5 | — | — | — | — | — | — | — | — | |
| Cap4VideoBackbone=CLIP-ViT-B/16, Venue=CVPR'232025.03 | 51.4 | 75.7 | 83.9 | — | 1 | 12.4 | — | — | — | — | — | |
| NarVidBackbone=CLIP-ViT-B/322025.03 | 51 | 76.4 | 85.2 | — | 1 | 11.6 | — | — | — | — | — | |
| ProTABackbone=CLIP-ViT-B/16, Venue=ICME'242025.03 | 50.9 | 77 | 85.4 | — | 1 | 11.1 | — | — | — | — | — | |
| UATVRBackbone=CLIP-ViT-B/16, Venue=ICCV'232025.03 | 50.8 | 76.3 | 85.5 | — | 1 | 12.4 | — | — | — | — | — | |
| DRLBackbone=CLIP-ViT-B/162022.09 | 50.2 | 76.5 | 84.7 | — | — | 1 | — | — | — | — | — | |
| T-MASSBackbone=CLIP-ViT-B/32, Venue=CVPR'242025.03 | 50.2 | 75.3 | 85.1 | — | 1 | 11.9 | — | — | — | — | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/322022.09 | 50.1 | 74.8 | 84.6 | — | — | 1 | — | — | — | — | — | |
| VAST, HowToCaption-finetunedV. Encoder=ViT-G2023.10 | 50 | 73.2 | 81.4 | — | — | 1 | — | — | — | — | — | |
| TEFALBackbone=CLIP-ViT-B/16, Venue=ICCV'232025.03 | 49.9 | 76.2 | 84.4 | — | 2 | 11.4 | — | — | — | — | — | |
| DMAEBackbone=ViT-B/162025.12 | 49.9 | 75.8 | 85.5 | — | — | — | — | — | — | — | — | |
| UCOFIABackbone=ViT-16, Method Category=CLIP-based2023.09 | 49.8 | 74.6 | 83.5 | — | 2 | 13.3 | — | — | — | — | — | |
| UCOFIAMethod Category=CLIP-based Methods2023.09 | 49.4 | 72.1 | — | — | — | 12.9 | — | — | — | — | — | |
| UCOFIABackbone=ViT-32, Method Category=CLIP-based2023.09 | 49.4 | 72.1 | 83.5 | — | 2 | 12.9 | — | — | — | — | — | |
| TEFALBackbone=CLIP-ViT-B/32, Venue=ICCV'232025.03 | 49.4 | 75.9 | 83.9 | — | 2 | — | — | — | — | — | — | |
| DRLBackbone=ViT-B/162025.12 | 49.4 | 76.4 | 84.2 | — | — | — | — | — | — | — | — | |
| Cap4 Video2024.06 | 49.3 | 74.3 | 83.8 | — | — | — | — | — | — | — | — | |
| CLIP2TVBackbone=CLIP-ViT-B/162022.09 | 49.3 | 74.7 | 83.6 | — | — | 2 | — | — | — | — | — | |
| VASTV. Encoder=ViT-G2023.10 | 49.3 | 68.3 | 73.9 | — | — | 2 | — | — | — | — | — | |
| Cap4VideoBackbone=CLIP-ViT-B/32, Venue=CVPR'232025.03 | 49.3 | 74.3 | 83.8 | — | 2 | 12 | — | — | — | — | — | |
| X-CLIPBackbone=CLIP-ViT-B/16, Venue=MM'222025.03 | 49.3 | 75.8 | 84.8 | — | 2 | 12.2 | — | — | — | — | — | |
| CLIP2TVBackbone=ViT-B/162025.12 | 49.3 | 74.7 | 83.6 | — | — | — | — | — | — | — | — | |
| X-CLIPBackbone=ViT-B/162025.12 | 49.3 | 75.8 | 84.8 | — | — | — | — | — | — | — | — | |
| MPTBackbone=CLIP-ViT-B/16, Venue=MM'242025.03 | 49.2 | 72.9 | 82.4 | — | — | 15.5 | — | — | — | — | — | |
| LamRAModel Size=7B, Evaluation Protocol=Zero-shot2026.02 | 48.9 | 71.6 | 79.5 | — | — | — | — | — | — | — | — | |
| LamRAModel Size=7B, Training Scale=Large vision-text scale2026.02 | 48.9 | 71.6 | 79.5 | — | — | — | — | — | — | — | — | |
| PAU2023.09 | 48.5 | 72.7 | 82.5 | — | 2 | 14 | — | — | — | — | — | |
| VAST†V. Encoder=ViT-G2023.10 | 48.5 | 71.2 | 79.8 | — | — | 2 | — | — | — | — | — | |
| PAUBackbone=CLIP-ViT-B/32, Venue=NeurIPS'232025.03 | 48.5 | 72.7 | 82.5 | — | 2 | 14 | — | — | — | — | — | |
| CenterCLIPBackbone=CLIP-ViT-B/162022.09 | 48.4 | 73.8 | 82 | — | — | 2 | — | — | — | — | — | |
| ProTABackbone=CLIP-ViT-B/32, Venue=ICME'242025.03 | 48.1 | 75.4 | 84.3 | — | 2 | 12.5 | — | — | — | — | — | |
| TeachClipBackbone=ViT-B/162025.12 | 48 | 75.9 | 83.5 | — | — | — | — | — | — | — | — | |
| TS2-NetBackbone=ViT-B/162025.12 | 47.8 | 76.8 | 85.2 | — | — | — | — | — | — | — | — | |
| UATVRBackbone=CLIP-ViT-B/32, Venue=ICCV'232025.03 | 47.5 | 73.9 | 83.5 | — | 2 | 12.3 | — | — | — | — | — | |
| DRLBackbone=CLIP-ViT-B/322022.09 | 47.4 | 74.6 | 83.8 | — | — | 2 | — | — | — | — | — | |
| CAMoEBackbone=CLIP-ViT-B/32, Post-processing=DSL2022.09 | 47.3 | 74.2 | 84.5 | — | — | 2 | — | — | — | — | — | |
| CLIP2VideoBackbone=CLIP-ViT-B/32, Post-processing=QB-Norm2022.09 | 47.2 | 73 | 83 | — | — | 2 | — | — | — | — | — | |
| mPLUG-2V. Encoder=ViT-L2023.10 | 47.1 | 69.7 | 79 | — | — | — | — | — | — | — | — | |
| TS2-Net2022.07 | 47 | 74.5 | 83.8 | — | 2 | — | 205.3 | — | — | — | — | |
| TS2-NetMethod Category=CLIP-based Methods2023.09 | 47 | 74.5 | — | — | — | 13 | — | — | — | — | — | |
| TS2-NetMethod Category=CLIP-based2023.09 | 47 | 74.5 | 83.8 | — | 2 | 13 | — | — | — | — | — | |
| XPoolBackbone=CLIP-ViT-B/322022.09 | 46.9 | 72.8 | 82.2 | — | — | 2 | — | — | — | — | — | |
| X-PoolMethod Category=CLIP-based Methods2023.09 | 46.9 | 72.8 | — | — | — | 14.3 | — | — | — | — | — | |
| X-poolMethod Category=CLIP-based2023.09 | 46.9 | 72.8 | 82.2 | — | 2 | 14.3 | — | — | — | — | — | |
| XPool2023.09 | 46.9 | 72.8 | 82.2 | — | 2 | 14.3 | — | — | — | — | — | |
| X-PoolBackbone=CLIP-ViT-B/32, Venue=CVPR'222025.03 | 46.9 | 72.8 | 82.2 | — | 2 | 14.3 | — | — | — | — | — | |
| B3Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 46.7 | 67.6 | 75.5 | — | — | — | — | — | — | — | — | |
| B3Model Size=7B, Training Scale=Large vision-text scale2026.02 | 46.7 | 67.6 | 75.5 | — | — | — | — | — | — | — | — | |
| UNITEModel Size=7B, Evaluation Protocol=Zero-shot2026.02 | 46.5 | 69.4 | 78 | — | — | — | — | — | — | — | — | |
| UNITEModel Size=7B, Training Scale=Large vision-text scale2026.02 | 46.5 | 69.4 | 78 | — | — | — | — | — | — | — | — | |
| Clip4ClipBackbone=ViT-B/162025.12 | 46.4 | 72.1 | 82 | — | — | — | — | — | — | — | — | |
| ELVA-7Bzero-shot=true2026.06 | 46.4 | 70.5 | 78.9 | — | — | — | — | — | — | — | — | |
| UMTVariant=B2024.06 | 46.3 | 72.7 | 82 | — | — | — | — | — | — | — | — | |
| MPTBackbone=CLIP-ViT-B/32, Venue=MM'242025.03 | 46.3 | 70.9 | 80.7 | — | — | 15.6 | — | — | — | — | — | |
| CLIP2TVBackbone=CLIP-ViT-B/322022.09 | 46.1 | 72.5 | 82.9 | — | — | 2 | — | — | — | — | — | |
| X-CLIPMethod Category=CLIP-based Methods2023.09 | 46.1 | 73 | — | — | — | 13.2 | — | — | — | — | — | |
| X-CLIPMethod Category=CLIP-based2023.09 | 46.1 | 73 | 83.1 | — | 2 | 13.2 | — | — | — | — | — | |
| CLIP2TV2023.09 | 46.1 | 72.5 | 82.9 | — | 2 | 15.2 | — | — | — | — | — | |
| X-CLIPBackbone=CLIP-ViT-B/32, Venue=MM'222025.03 | 46.1 | 73 | 83.1 | — | 2 | 13.2 | — | — | — | — | — | |
| CLIP2Video2024.06 | 45.6 | 72.5 | 81.7 | — | — | — | — | — | — | — | — | |
| CLIP2Video2022.07 | 45.6 | 72.6 | 81.7 | — | 2 | — | 199.9 | — | — | — | — | |
| CLIP2VideoBackbone=CLIP-ViT-B/322022.09 | 45.6 | 72.6 | 81.7 | — | — | 2 | — | — | — | — | — | |
| CLIP2Video2023.09 | 45.6 | 72.6 | 81.7 | — | 2 | 14.6 | — | — | — | — | — | |
| Baseline2023.09 | 45.6 | 72.9 | 81.5 | — | 2 | 14.5 | — | — | — | — | — | |
| VindLUMethod Category=Non-CLIP Methods, Pretraining Strategy=Pretrained on large-scale video datasets, Retrieval Strategy=Two-stage re-ranking2023.09 | 45.3 | 69.9 | — | — | — | — | — | — | — | — | — | |
| MMRet-v1.5Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 45.2 | 67.5 | 75.9 | — | — | — | — | — | — | — | — | |
| MMRet-v1.5Model Size=7B, Training Scale=Large vision-text scale2026.02 | 45.2 | 67.5 | 75.9 | — | — | — | — | — | — | — | — | |
| BridgeFormerEvaluation Protocol=Fine-tuned2022.01 | 44.9 | 71.9 | 80.3 | — | 2 | 15.3 | — | — | — | — | — | |
| LamRA-7Bzero-shot=true2026.06 | 44.7 | 68.6 | 78.6 | — | — | — | — | — | — | — | — | |
| CAMOEMethod Category=CLIP-based Methods2023.09 | 44.6 | 72.6 | — | — | — | 13.3 | — | — | — | — | — | |
| CAMOEMethod Category=CLIP-based2023.09 | 44.6 | 72.6 | 81.8 | — | 2 | 13.3 | — | — | — | — | — |