Video-to-Text Retrieval on MSVD
88.4R@1PEAV-L
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 88.4 | — | — | — | — | — | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 87.6 | — | — | — | — | — | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 87.6 | — | — | — | — | — | — | — | |
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 87.6 | — | — | — | — | — | — | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 87.5 | — | — | — | — | — | — | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 86.4 | — | — | — | — | — | — | — | |
| VidVecV-T Pairs=Text-Only2026.02 | 85.7 | — | — | — | — | — | — | — | |
| VidVec-OModel Size=7B, Embedding=Optimized2026.02 | 85.7 | 95.5 | 97.8 | — | — | — | — | — | |
| PE-Core-GV-T Pairs=22M2026.02 | 85.4 | — | — | — | — | — | — | — | |
| PE-GV-Enc Params=1.9B, Video Data=22M, Resolution=448, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 85.4 | — | — | — | — | — | — | — | |
| PE-coreGSetting=ZS2026.05 | 85.4 | — | — | — | — | — | — | — | |
| InternVideo2s2-6BFinetuning=true2024.03 | 85.2 | — | — | — | — | — | — | — | |
| InternVideo2V-Enc Params=1.0B, Video Data=102M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 83.3 | — | — | — | — | — | — | — | |
| InternVideo2-1BSetting=ZS2026.05 | 83.3 | — | — | — | — | — | — | — | |
| InternVideo2-6BV-T Pairs=100M2026.02 | 83.1 | — | — | — | — | — | — | — | |
| B3Model Size=7B2026.02 | 83.1 | 95.2 | 97.2 | — | — | — | — | — | |
| UMT-LFinetuning=true2024.03 | 82.4 | — | — | — | — | — | — | — | |
| PE-LV-Enc Params=0.3B, Video Data=22M, Resolution=336, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 82.4 | — | — | — | — | — | — | — | |
| PE-coreLSetting=ZS2026.05 | 82.4 | — | — | — | — | — | — | — | |
| VLM2Vec-V2Model Size=7B2026.02 | 82.1 | 95.1 | 97.5 | — | — | — | — | — | |
| UniME-V2Model Size=7B2026.02 | 81.8 | 93.4 | 95.5 | — | — | — | — | — | |
| VLM2VecModel Size=7B2026.02 | 81.3 | 93.1 | 95.7 | — | — | — | — | — | |
| LamRAModel Size=7B2026.02 | 81.2 | 92.5 | 95.5 | — | — | — | — | — | |
| VidLA-B/16Backbone=CLIP-ViT-B/16, dual-softmax=true2024.03 | 80.3 | 97.2 | 98.4 | — | — | — | 92 | — | |
| LanguageBindV-Enc Params=0.3B, Video Data=10M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 78.8 | — | — | — | — | — | — | — | |
| Gemini Embedding 2Setting=ZS2026.05 | 77.92 | — | — | — | — | — | — | — | |
| VidLA-B/32Backbone=CLIP-ViT-B/32, dual-softmax=true2024.03 | 77.4 | 96 | 98.7 | — | — | — | 90.7 | — | |
| MMRet-v1.5Model Size=7B2026.02 | 77.2 | 90.9 | 93.4 | — | — | — | — | — | |
| PE-coreBSetting=ZS2026.05 | 76.7 | — | — | — | — | — | — | — | |
| InternVideoBackbone=ViT-L/142022.12 | 76.3 | — | — | — | — | — | — | — | |
| InternVideo (ViT-L)Backbone=CLIP-ViT-B/16, dual-softmax=true2024.03 | 76.3 | — | — | — | — | — | — | — | |
| UNITEModel Size=7B2026.02 | 76.1 | 91.3 | 94.6 | — | — | — | — | — | |
| UMT-LV-T Pairs=10M2026.02 | 75.4 | — | — | — | — | — | — | — | |
| ViCLIPV-T Pairs=n/a2026.02 | 75.1 | — | — | — | — | — | — | — | |
| SigLIP2-g-optV-Enc Params=1.1B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 74.6 | — | — | — | — | — | — | — | |
| SigLIP-2-g-optSetting=ZS2026.05 | 74.6 | — | — | — | — | — | — | — | |
| UMT-LV-Enc Params=0.3B, Video Data=25M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 74.5 | — | — | — | — | — | — | — | |
| SigLIP2-L/16V-Enc Params=0.3B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 74.2 | — | — | — | — | — | — | — | |
| SigLIP-2-L/16Setting=ZS2026.05 | 74.2 | — | — | — | — | — | — | — | |
| UMTBackbone=CLIP-ViT-B/16, two-stage method with candidate re-ranking=true2024.03 | 74 | 94.6 | 97.3 | — | — | — | 88.6 | — | |
| LanguageBindV-T Pairs=10M2026.02 | 72 | — | — | — | — | — | — | — | |
| LanguageBind (CLIP-H/14)Setting=ZS2026.05 | 72 | — | — | — | — | — | — | — | |
| ImageBindV-Enc Params=0.6B, Video Data=3M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 70.9 | — | — | — | — | — | — | — | |
| VidLA-B/16Backbone=CLIP-ViT-B/162024.03 | 68.8 | 93.4 | 96.2 | — | — | — | 86.1 | — | |
| DRLBackbone=CLIP-ViT-B/162024.03 | 68.7 | 92.5 | 95.6 | — | — | — | 85.6 | — | |
| CenterCLIPBackbone=CLIP-ViT-B/162024.03 | 68.4 | 90.1 | 95 | — | — | — | 84.5 | — | |
| HunYuan_tvrParameters=364M, Data=400M, Protocol=Weight Transfer2022.06 | 68 | — | — | — | — | — | — | — | |
| Uni-Perceiver-L + Conditional MoEsParameters=505M, Data=44.1M, Protocol=Fine-tuning (100%)2022.06 | 67.6 | — | — | — | — | — | — | — | |
| InternVideoZero-shot=true2022.12 | 67.6 | — | — | — | — | — | — | — | |
| InternVideo-LV-T Pairs=12M2026.02 | 67.6 | — | — | — | — | — | — | — | |
| SigLIP-2-B/16Setting=ZS2026.05 | 67.2 | — | — | — | — | — | — | — | |
| X-CLIPBackbone=ViT-B/162022.07 | 66.8 | 90.4 | — | — | 4.2 | — | — | — | |
| X-CLIP2022.12 | 66.8 | — | — | — | — | — | — | — | |
| X-CLIPSetting=FT2026.05 | 66.8 | — | — | — | — | — | — | — | |
| VidLA-B/32Backbone=CLIP-ViT-B/322024.03 | 66.5 | 92.4 | 95.6 | — | — | — | 84.8 | — | |
| Uni-Perceiver-L + Conditional MoEsParameters=505M, Data=44.1M, Protocol=Prompt Tuning (1%)2022.06 | 66.4 | — | — | — | — | — | — | — | |
| Uni-Perceiver-B + Conditional MoEsParameters=167M, Data=44.1M, Protocol=Prompt Tuning (1%)2022.06 | 65.6 | — | — | — | — | — | — | — | |
| Uni-Perceiver-LParameters=354M, Data=44.1M, Protocol=Prompt Tuning (1%)2022.06 | 65.5 | — | — | — | — | — | — | — | |
| Uni-Perceiver-LParameters=354M, Data=44.1M, Protocol=Fine-tuning (100%)2022.06 | 65.2 | — | — | — | — | — | — | — | |
| Uni-Perceiver-B + Conditional MoEsParameters=167M, Data=44.1M, Protocol=Fine-tuning (100%)2022.06 | 65 | — | — | — | — | — | — | — | |
| CenterCLIPBackbone=CLIP-ViT-B/322024.03 | 63.5 | 86.4 | 92.6 | — | — | — | 80.8 | — | |
| OmniRetriever-7BSetting=ZS2026.05 | 63.33 | — | — | — | — | — | — | — | |
| CLIPZero-shot=true2022.12 | 63.3 | — | — | — | — | — | — | — | |
| CLIP4Clip-seqTransfBackbone=ViT-B/162022.07 | 63.2 | 87.2 | — | — | 4.2 | — | — | — | |
| CLIP4Clip-MeanPBackbone=ViT-B/162022.07 | 62.9 | 87.2 | — | — | 4.2 | — | — | — | |
| Uni-Perceiver-BParameters=124M, Data=44.1M, Protocol=Fine-tuning (100%)2022.06 | 62.8 | — | — | — | — | — | — | — | |
| Uni-Perceiver-BParameters=124M, Data=44.1M, Protocol=Prompt Tuning (1%)2022.06 | 62.7 | — | — | — | — | — | — | — | |
| DREAM2026.06 | 62.6 | 87.9 | 92.5 | 1 | 4.1 | — | — | — | |
| DRLBackbone=CLIP-ViT-B/322024.03 | 62.3 | 86.3 | 92.2 | — | — | — | 80.3 | — | |
| CLIP4Clip-seqTransfBackbone=ViT-B/322022.07 | 62 | 87.3 | — | — | 4.3 | — | — | — | |
| CLIP4Clip2023.03 | 62 | 87.3 | 92.6 | 1 | 4.3 | 241.9 | — | — | |
| CLIP4ClipBackbone=CLIP-ViT-B/322024.03 | 62 | 87.3 | 92.6 | — | — | — | 80.6 | — | |
| CLIP4Clip-seqTransfAggregation=temporal transformer2021.06 | 62 | 87.3 | 92.6 | 1 | 4.3 | — | — | — | |
| DiffusionRet2023.03 | 61.9 | 88.3 | 92.9 | 1 | 4.5 | 243.1 | — | — | |
| DiffusionRetBackbone=CLIP-ViT-B/322024.03 | 61.9 | 88.3 | 92.9 | — | — | — | 81 | — | |
| Align and TellYear=20232026.06 | 61.8 | 87.5 | 92.7 | 1 | — | — | — | — | |
| X-CLIPBackbone=ViT-B/322022.07 | 60.9 | 87.8 | — | — | 4.7 | — | — | — | |
| DiffusionRetPost-processing=QB-Norm2023.03 | 60.3 | 86.4 | 92 | 1 | 4.5 | 238.7 | — | — | |
| CLIPTraining=WIT2021.02 | 59.9 | 85.2 | 90.7 | 1 | — | — | — | — | |
| CLIP-straight2022.07 | 59.9 | 85.2 | — | — | — | — | — | — | |
| CLIP2021.06 | 59.9 | 85.2 | 90.7 | 1 | — | — | — | — | |
| CLIP2Video2021.06 | 58.7 | 85.6 | 91.6 | 1 | 4.3 | — | — | — | |
| HAT-VTRBase Model=Xpool, Adaptation Method=HAT-VTR2026.02 | 57.91 | 85.97 | 92.39 | — | — | — | — | — | |
| CLIP4Clip-MeanPBackbone=ViT-B/322022.07 | 56.6 | 79.7 | — | — | 7.6 | — | — | — | |
| CLIP4Clip-meanPAggregation=mean pooling2021.06 | 56.6 | 79.7 | 84.3 | 1 | 7.6 | — | — | — | |
| Clip4ClipYear=20222026.06 | 56.6 | 79.7 | 84.3 | 1 | 7.6 | — | — | — | |
| CLIP4ClipSetting=FT2026.05 | 56 | — | — | — | — | — | — | — | |
| HAT-VTRBase Model=CLIP4Clip, Adaptation Method=HAT-VTR2026.02 | 55.67 | 82.99 | 91.49 | — | — | — | — | — | |
| TentBase Model=Xpool, Adaptation Method=Tent2026.02 | 54.63 | 85.22 | 91.79 | — | — | — | — | — | |
| XpoolBase Model=Xpool, Adaptation Method=None2026.02 | 54.48 | 85.22 | 91.49 | — | — | — | — | — | |
| EATABase Model=Xpool, Adaptation Method=EATA2026.02 | 54.48 | 85.97 | 91.79 | — | — | — | — | — | |
| SARBase Model=Xpool, Adaptation Method=SAR2026.02 | 54.33 | 85.22 | 91.64 | — | — | — | — | — | |
| TCRBase Model=Xpool, Adaptation Method=TCR2026.02 | 54.33 | 84.93 | 92.39 | — | — | — | — | — | |
| EMCL-Net2023.03 | 54.3 | 81.3 | 88.1 | 1 | 5.6 | 223.7 | — | — | |
| READBase Model=Xpool, Adaptation Method=READ2026.02 | 54.18 | 85.37 | 91.64 | — | — | — | — | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 54.1 | 81.1 | 88.1 | — | — | — | — | — | |
| CLIP4ClipBase Model=CLIP4Clip, Adaptation Method=None2026.02 | 54.03 | 83.43 | 90.9 | — | — | — | — | — | |
| TentBase Model=CLIP4Clip, Adaptation Method=Tent2026.02 | 54.03 | 83.58 | 90.9 | — | — | — | — | — | |
| LanguageBindBackbone=CLIP-H/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 53.9 | 80.4 | 87.8 | — | — | — | — | — | |
| EATABase Model=CLIP4Clip, Adaptation Method=EATA2026.02 | 53.88 | 82.99 | 90.9 | — | — | — | — | — |