Text-to-Video Retrieval on LSMDC
46.4R@1InternVideo2s2-6B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| InternVideo2s2-6BFinetuning=true2024.03 | 46.4 | — | — | — | — | — | — | |
| UMT-L#Pairs=25M2023.03 | 43 | 65.5 | 73 | — | — | — | — | |
| UMT-LFinetuning=true2024.03 | 43 | — | — | — | — | — | — | |
| UMT-L#Pairs=17M2023.03 | 41.4 | 63.8 | 72.3 | — | — | — | — | |
| UMT-L#Pairs=5M2023.03 | 37.7 | 60.6 | 67.3 | — | — | — | — | |
| InternVideo#Pairs=646M2023.03 | 34 | 53.7 | 62.9 | — | — | — | — | |
| ViCLIPFinetuning=true2024.03 | 33 | — | — | — | — | — | — | |
| SCLEvaluation protocol=Fine-tune2022.11 | 32.8 | 62.5 | 72.9 | — | — | — | — | |
| UMT-B#Pairs=25M2023.03 | 32.7 | 54.7 | 63.4 | — | — | — | — | |
| UMT-B#Pairs=17M2023.03 | 32.3 | 54.5 | 61.9 | — | — | — | — | |
| UMT-B#Pairs=5M2023.03 | 30.3 | 51.8 | 61.4 | — | — | — | — | |
| T-MASSBackbone=CLIP-ViT-B/162024.03 | 30.3 | 52.2 | 61.3 | 5 | 40.1 | — | — | |
| CLIP-ViP#Pairs=500M2023.03 | 29.4 | 50.6 | 59 | — | — | — | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/162024.03 | 29.4 | 50.6 | 59 | 5 | — | — | — | |
| T-MASSBackbone=CLIP-ViT-B/322024.03 | 28.9 | 48.2 | 57.6 | 6 | 43.3 | — | — | |
| HiTeA#Pairs=17M2023.03 | 28.7 | 50.3 | 59 | — | — | — | — | |
| TEFALBackbone=CLIP-ViT-B/322024.03 | 26.8 | 46.1 | 56.5 | 7 | 44.4 | — | — | |
| X-CLIPBackbone=ViT-B/162022.07 | 26.1 | 48.4 | — | — | 46.7 | — | — | |
| LAVENDER#Pairs=30M2023.03 | 26.1 | 46.4 | 57.3 | — | — | — | — | |
| X-PoolBackbone=CLIP-ViT-B/162024.03 | 26.1 | 46.8 | 56.7 | 7 | 47.3 | — | — | |
| HVD2026.01 | 26.1 | — | 57 | — | — | — | — | |
| UMT-LSetting=Zero-shot2026.04 | 26 | 43.1 | 51.6 | — | — | — | — | |
| CAMoEDual Softmax Loss=true2021.09 | 25.9 | 46.1 | 53.7 | — | 54.4 | — | — | |
| EMCL-NetPre-trained weights=CLIP (ViT-B/32), inverted softmax=true2022.11 | 25.9 | 46.4 | 53.7 | 8 | — | — | — | |
| CLIP-ViPBackbone=CLIP-ViT-B/322024.03 | 25.6 | 45.3 | 54.4 | 8 | — | — | — | |
| CLIP-VIP2026.01 | 25.6 | — | 54.4 | — | — | — | — | |
| FluxViT-BToken count=2048, Dual Softmax Loss=true, Zero-shot=true2025.03 | 25.4 | — | — | — | — | — | — | |
| DiCoSA2026.01 | 25.4 | — | 54 | — | — | — | — | |
| X-Pool2022.03 | 25.2 | 43.7 | 53.5 | 8 | 53.2 | — | — | |
| X-PoolBackbone=CLIP-ViT-B/322024.03 | 25.2 | 43.7 | 53.5 | 8 | 53.2 | — | — | |
| X-Pool2026.01 | 25.2 | — | 53.5 | — | — | — | — | |
| UMT-LZero-shot=true2025.03 | 24.9 | — | — | — | — | — | — | |
| DiffusionRetBackbone=CLIP-ViT-B/322024.03 | 24.4 | 43.1 | 54.3 | 8 | 40.7 | — | — | |
| CLIP4ClipFinetuning=true2024.03 | 24.3 | — | — | — | — | — | — | |
| FluxViT-BToken count=1024, Dual Softmax Loss=true, Zero-shot=true2025.03 | 24.1 | — | — | — | — | — | — | |
| VIOLETv2Pre-training Data Size=5M2022.09 | 24 | 43.5 | 54.1 | — | — | — | — | |
| EMCL-NetPre-trained weights=CLIP (ViT-B/32)2022.11 | 23.9 | 42.4 | 50.9 | 10 | — | — | — | |
| EMCL-Net2026.01 | 23.9 | — | 53.7 | — | — | — | — | |
| FluxViT-BToken count=2048, Dual Softmax Loss=false, Zero-shot=true2025.03 | 23.7 | — | — | — | — | — | — | |
| DiscoVLABackbone=CLIP (ViT-B/32), # Params (M)=0.562025.06 | 23.6 | 42 | 52.3 | — | 52 | — | 117.9 | |
| CLIP4Clip-MeanPBackbone=ViT-B/162022.07 | 23.5 | 43.2 | — | — | 54.8 | — | — | |
| CLIP4Clip-seqTransfBackbone=ViT-B/162022.07 | 23.5 | 45.2 | — | — | 51.6 | — | — | |
| InstAPSetting=Zero-shot2026.04 | 23.5 | 42.7 | 50.3 | — | — | — | — | |
| X-CLIPBackbone=ViT-B/322022.07 | 23.3 | 43 | — | — | 56 | — | — | |
| FluxViT-BToken count=512, Dual Softmax Loss=true, Zero-shot=true2025.03 | 22.8 | — | — | — | — | — | — | |
| CloverEvaluation protocol=Fine-tune2022.11 | 22.7 | 42 | 52.6 | — | — | — | — | |
| CLIP4ClipAggregation Strategy=sequential Transformer2022.03 | 22.6 | 41 | 49.1 | 11 | 61 | — | — | |
| CLIP4Clip-seqTransfBackbone=ViT-B/322022.07 | 22.6 | 41 | — | — | 61 | — | — | |
| CLIP4ClipPre-trained weights=CLIP (ViT-B/32)2022.11 | 22.6 | 41 | 49.1 | 11 | — | — | — | |
| FluxViT-BToken count=1024, Dual Softmax Loss=false, Zero-shot=true2025.03 | 22.6 | — | — | — | — | — | — | |
| CAMoE2021.09 | 22.5 | 42.6 | 50.9 | — | 56.5 | — | — | |
| CLIPFinetuning=true2024.03 | 22.5 | — | — | — | — | — | — | |
| FluxViT-SToken count=2048, Dual Softmax Loss=true, Zero-shot=true2025.03 | 22.4 | — | — | — | — | — | — | |
| FullParams (M)=119.82022.11 | 22 | 39.9 | 49.9 | 11 | 56.8 | — | — | |
| CLIP4Clip2021.09 | 21.6 | 41.8 | 49.8 | — | 58 | — | — | |
| Clip4ClipPre-training Data Size=400M2022.09 | 21.6 | 41.8 | 49.8 | — | — | — | — | |
| CLIP4Clip#Pairs=400M2023.03 | 21.6 | 41.8 | 49.8 | — | — | — | — | |
| InternVideo2-LZero-shot=true2025.03 | 21.4 | — | — | — | — | — | — | |
| DGLBackbone=CLIP (ViT-B/32), # Params (M)=0.832025.06 | 21.4 | 39.4 | 48.4 | — | 64.3 | — | 109.2 | |
| VoPF+CParams (M)=14.12022.11 | 21.1 | 40.9 | 49.6 | 11 | 60.1 | — | — | |
| VoPF+CBackbone=CLIP (ViT-B/32), # Params (M)=14.102025.06 | 21.1 | 40.9 | 49.6 | — | 60.1 | — | 111.6 | |
| CLIP4Clip-seqLSTMTrainD=W+L, E2E=false2021.04 | 20.9 | 40.7 | 49.1 | 11 | 53.9 | — | — | |
| CLIP4Clip-seqTransfTrainD=W+L, E2E=false2021.04 | 20.8 | 39 | 48.6 | 12 | 54.2 | — | — | |
| FluxViT-SToken count=2048, Dual Softmax Loss=false, Zero-shot=true2025.03 | 20.8 | — | — | — | — | — | — | |
| CLIP4ClipAggregation Strategy=mean-pooling2022.03 | 20.7 | 38.9 | 47.2 | 13 | 65.3 | — | — | |
| CLIP4Clip-MeanPBackbone=ViT-B/322022.07 | 20.7 | 38.9 | — | — | 65.3 | — | — | |
| VoPF+PParams (M)=0.42022.11 | 20.7 | 40.7 | 49.7 | 11 | 59.1 | — | — | |
| Full fine-tuningBackbone=CLIP (ViT-B/32), # Params (M)=123.542025.06 | 20.7 | 38.9 | 47.2 | — | 65.3 | — | 106.8 | |
| VoPF+PBackbone=CLIP (ViT-B/32), # Params (M)=0.42025.06 | 20.7 | 40.7 | 49.7 | — | 59.1 | — | 111.1 | |
| CLIP4Clip-meanPTrainD=W+L, E2E=false2021.04 | 20.6 | 39.4 | 47.5 | 13 | 56.7 | — | — | |
| VoPFParams (M)=0.12022.11 | 20.6 | 39.5 | 49.1 | 11 | 60.3 | — | — | |
| FluxViT-SToken count=1024, Dual Softmax Loss=true, Zero-shot=true2025.03 | 20.5 | — | — | — | — | — | — | |
| VoPCParams (M)=14.32022.11 | 20.4 | 40 | 48.1 | 12 | 65.9 | — | — | |
| ViClip-LZero-shot=true2025.03 | 20.1 | — | — | — | — | — | — | |
| FluxViT-BToken count=512, Dual Softmax Loss=false, Zero-shot=true2025.03 | 20.1 | — | — | — | — | — | — | |
| UMT-L (InstVL; g)Setting=Zero-shot2026.04 | 19.9 | 38.4 | 46.5 | — | — | — | — | |
| VoPPParams (M)=0.52022.11 | 19.2 | 38.3 | 47.3 | 12 | 64.4 | — | — | |
| UMT-BZero-shot=true2025.03 | 19.1 | — | — | — | — | — | — | |
| VoPParams (M)=0.12022.11 | 19 | 37.9 | 46.5 | 14 | 66.9 | — | — | |
| FluxViT-SToken count=512, Dual Softmax Loss=true, Zero-shot=true2025.03 | 19 | — | — | — | — | — | — | |
| MDMMT2021.09 | 18.8 | 38.5 | 47.9 | — | 58 | — | — | |
| MDMMT2022.03 | 18.8 | 38.5 | 47.9 | 12.3 | 58 | — | — | |
| MDMMT2022.07 | 18.8 | 38.5 | — | — | 58 | — | — | |
| Ju et al.Params (M)=4.8, backbone=CLIP with ViT-B/162022.11 | 18.8 | 38.5 | 47.9 | 12.3 | — | — | — | |
| AdapterFFNParams (M)=2.02022.11 | 18.7 | 38.9 | 47.3 | 13 | 63.6 | — | — | |
| InternVideo2-BToken count=2048, Zero-shot=true2025.03 | 18.7 | — | — | — | — | — | — | |
| FluxViT-SToken count=1024, Dual Softmax Loss=false, Zero-shot=true2025.03 | 18.7 | — | — | — | — | — | — | |
| AdapterATTNParams (M)=2.02022.11 | 18.4 | 38 | 46.4 | 13 | 68.9 | — | — | |
| HiTeA# PT Data=17M, Evaluation mode=Zero-shot2022.12 | 18.3 | 36.7 | 44.2 | — | — | — | — | |
| PartialParams (M)=7.72022.11 | 18 | 33.8 | 41.8 | 18 | 79.9 | — | — | |
| MCQEvaluation protocol=Fine-tune2022.11 | 17.9 | 35.4 | 44.5 | — | — | — | — | |
| BridgeFormerPre-training Data Size=5M2022.09 | 17.9 | 35.4 | 44.5 | — | — | — | — | |
| MILESEvaluation protocol=Fine-tune2022.11 | 17.8 | 35.6 | 44.1 | — | — | — | — | |
| FluxViT-SToken count=512, Dual Softmax Loss=false, Zero-shot=true2025.03 | 17.7 | — | — | — | — | — | — | |
| InternVideoZero-shot=true2022.12 | 17.6 | — | — | — | — | — | — | |
| InternVideo-LZero-shot=true2025.03 | 17.6 | — | — | — | — | — | — | |
| TT-CE+TrainD=L, E2E=false2021.04 | 17.5 | 36 | 45 | 14.3 | — | — | — | |
| UMT-L (InstVL; g+i)Setting=Zero-shot2026.04 | 17.5 | 36.6 | 46.5 | — | — | — | — | |
| CLIP4Clip-tightTransfTrainD=W+L, E2E=true2021.04 | 17.4 | 36.7 | 45 | 15 | 65.3 | — | — | |
| BiasParams (M)=0.12022.11 | 17.4 | 36.2 | 44.9 | 14 | 73.2 | — | — |