Video-to-Text Retrieval on DiDeMo
71.9R@1InternVideo2s2-6B
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| InternVideo2s2-6BFinetuning=true2024.03 | 71.9 | — | — | — | — | — | — | — | |
| PMRLsetting=finetuning2025.07 | 66.4 | — | — | — | — | — | — | — | |
| UMT-LFinetuning=true2024.03 | 65.7 | — | — | — | — | — | — | — | |
| UMT-LModality=T-V, Finetuning and evaluation frames=122024.12 | 65.7 | — | — | — | — | — | — | — | |
| UMT-LModality=T-V, Finetuning=true, Evaluation frames=122024.12 | 65.7 | — | — | — | — | — | — | — | |
| UMT-Lsetting=finetuning, evaluation_frames=122025.07 | 65.7 | — | — | — | — | — | — | — | |
| GRAMsetting=finetuning2025.07 | 65.7 | — | — | — | — | — | — | — | |
| VASTsetting=finetuning2025.07 | 65.4 | — | — | — | — | — | — | — | |
| vid-TLDRModality=T-V, Finetuning=true, Evaluation frames=122024.12 | 65.2 | — | — | — | — | — | — | — | |
| GRAM ModelModality=T-VA2024.12 | 63.5 | — | — | — | — | 91.4 | — | — | |
| GRAM ModelModality=T-VA, Finetuning=true2024.12 | 63.5 | — | — | — | — | — | — | — | |
| GRAM ModelModality=T-V2024.12 | 63.2 | — | — | — | — | 91.6 | — | — | |
| GRAM ModelModality=T-V, Finetuning=true2024.12 | 63.2 | — | — | — | — | — | — | — | |
| VASTModality=T-VA2024.12 | 62 | — | — | — | — | 87.7 | — | — | |
| VASTModality=T-VA, Finetuning=true2024.12 | 62 | — | — | — | — | — | — | — | |
| InternVideo-LModality=T-V, Finetuning=true, Evaluation frames=122024.12 | 59.1 | — | — | — | — | — | — | — | |
| InternVideo-Lsetting=finetuning, evaluation_frames=122025.07 | 59.1 | — | — | — | — | — | — | — | |
| VindLU2026.01 | 57.2 | 83.1 | — | — | — | 88.9 | — | — | |
| InternVideo2-6BV-T Pairs=100M2026.02 | 57.1 | — | — | — | — | — | — | — | |
| HiTeAModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 56.5 | — | — | — | — | — | — | — | |
| VidVecV-T Pairs=Text-Only2026.02 | 56.5 | — | — | — | — | — | — | — | |
| VidVec-OModel Size=7B, Embedding=Optimized2026.02 | 56.5 | 79.7 | — | — | — | 86 | — | — | |
| InternVideo2V-Enc Params=1.0B, Video Data=102M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 54.3 | — | — | — | — | — | — | — | |
| InternVideo2-1BSetting=ZS2026.05 | 54.3 | — | — | — | — | — | — | — | |
| Gemini Embedding 2Setting=ZS2026.05 | 53.33 | — | — | — | — | — | — | — | |
| AuroraRank (r)=64, Input=8x224, Pretraining Parameters=129M, Tunable Parameters=0.1M, Training Protocol=frozen backbone2023.05 | 53.1 | 77.4 | — | 1 | — | 85.3 | — | — | |
| GRAMModality=T-V, Zero-shot=true2024.12 | 52.3 | — | — | — | — | — | — | — | |
| GRAM ModelModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 52.3 | — | — | — | — | 80.3 | — | — | |
| GRAMModality=T-VA, Zero-shot=true2024.12 | 52.2 | — | — | — | — | — | — | — | |
| GRAM ModelModality=T-VA, Evaluation Protocol=Zero-shot2024.12 | 52.2 | — | — | — | — | 78.9 | — | — | |
| GRAMModality=T-VA, Zero-shot=true2026.02 | 52.2 | — | — | — | — | — | — | — | |
| UniAdapterRank (r)=512, Input=8x224, Pretraining Parameters=129M, Tunable Parameters=18.8M, Training Protocol=frozen backbone2023.05 | 52.1 | 77.3 | — | 1 | — | 85.2 | — | — | |
| UniAlign*Modality=T-VA, Zero-shot=true, Tuple-level losses=false2026.02 | 51.9 | — | — | — | — | — | — | — | |
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 51.7 | — | — | — | — | — | — | — | |
| UniAlignModality=T-VA, Zero-shot=true, Tuple-level losses=true2026.02 | 51.6 | — | — | — | — | — | — | — | |
| LoRARank (r)=32, Input=8x224, Pretraining Parameters=129M, Tunable Parameters=10.6M, Training Protocol=frozen backbone2023.05 | 50.9 | 75.3 | — | 2 | — | 82.4 | — | — | |
| ViCLIPFinetuning=true2024.03 | 50.2 | — | — | — | — | — | — | — | |
| ViCLIPModality=T-V2024.12 | 50.2 | — | — | — | — | — | — | — | |
| ViCLIPModality=T-V, Finetuning=true2024.12 | 50.2 | — | — | — | — | — | — | — | |
| ViCLIPsetting=finetuning2025.07 | 50.2 | — | — | — | — | — | — | — | |
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 50.1 | — | — | — | — | — | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 50.1 | — | — | — | — | — | — | — | |
| UMT-LModality=T-V, Zero-shot=true2024.12 | 49.9 | — | — | — | — | — | — | — | |
| UMT-LV-T Pairs=10M2026.02 | 49.9 | — | — | — | — | — | — | — | |
| UMT-LModality=T-V, Zero-shot=true2026.02 | 49.9 | — | — | — | — | — | — | — | |
| UMT-LV-Enc Params=0.3B, Video Data=25M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 49.9 | — | — | — | — | — | — | — | |
| UMT-LZero-shot=true2025.07 | 49.9 | — | — | — | — | — | — | — | |
| UniAdapterRank (r)=128, Input=8x224, Pretraining Parameters=129M, Tunable Parameters=4.6M, Training Protocol=frozen backbone2023.05 | 49 | 75.5 | — | 2 | — | 83.3 | — | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 49 | — | — | — | — | — | — | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 49 | — | — | — | — | — | — | — | |
| GRAMZero-shot=true2025.07 | 48.5 | — | — | — | — | — | — | — | |
| PMRLZero-shot=true2025.07 | 48.4 | — | — | — | — | — | — | — | |
| VASTModality=T-VA, Zero-shot=true2024.12 | 48.2 | — | — | — | — | — | — | — | |
| VASTModality=T-VA, Evaluation Protocol=Zero-shot2024.12 | 48.2 | — | — | — | — | 78.6 | — | — | |
| VASTModality=T-VA, Zero-shot=true2026.02 | 48.2 | — | — | — | — | — | — | — | |
| MAMABase Model=CLIP-ViP2026.01 | 48.1 | 78.1 | — | — | — | 85.5 | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 47.8 | — | — | — | — | — | — | — | |
| X-CLIPSetting=FT2026.05 | 47.8 | — | — | — | — | — | — | — | |
| Vid2SeqBase Model=CLIP-ViP2026.01 | 47.2 | 74.4 | — | — | — | 83.1 | — | — | |
| LamRAModel Size=7B2026.02 | 47.1 | 72.8 | — | — | — | 81.5 | — | — | |
| LaViLaBase Model=CLIP-ViP2026.01 | 47.1 | 74.2 | — | — | — | 83 | — | — | |
| PE-GV-Enc Params=1.9B, Video Data=22M, Resolution=448, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 46.5 | — | — | — | — | — | — | — | |
| CLIP-ViP2026.01 | 46.3 | 73.2 | — | — | — | 81.9 | — | — | |
| MMRet-v1.5Model Size=7B2026.02 | 46.1 | 73.1 | — | — | — | 80.7 | — | — | |
| CAMoE2021.09 | 45.5 | 71.2 | — | — | — | — | — | — | |
| DRL2026.01 | 45.4 | 72.6 | — | — | — | 82.1 | — | — | |
| VASTZero-shot=true2025.07 | 45.3 | — | — | — | — | — | — | — | |
| OmniRetriever-7BSetting=ZS2026.05 | 45.08 | — | — | — | — | — | — | — | |
| VIOLET2026.01 | 44.8 | 72.9 | — | — | — | 82.4 | — | — | |
| LanguageBindV-Enc Params=0.3B, Video Data=10M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 44.7 | — | — | — | — | — | — | — | |
| VLM2Vec-V2Model Size=7B2026.02 | 44.2 | 68 | — | — | — | 76.1 | — | — | |
| CLIP4ClipFinetuning=true2024.03 | 43.6 | — | — | — | — | — | — | — | |
| CLIP4ClipModality=T-V2024.12 | 43.6 | — | — | — | — | — | — | — | |
| CLIP4ClipModality=T-V, Finetuning=true2024.12 | 43.6 | — | — | — | — | — | — | — | |
| CLIP4Clipsetting=finetuning2025.07 | 43.6 | — | — | — | — | — | — | — | |
| B3Model Size=7B2026.02 | 43.3 | 65.3 | — | — | — | 72.5 | — | — | |
| CLIP4ClipInput=12x224, Pretraining Parameters=400M, Tunable Parameters=124M, Training Protocol=full fine-tuning2023.05 | 42.8 | 68.5 | — | 2 | — | 79.2 | — | — | |
| CLIP4ClipSetting=FT2026.05 | 42.5 | — | — | — | — | — | — | — | |
| VLM2VecModel Size=7B2026.02 | 41.3 | 65.4 | — | — | — | 72.5 | — | — | |
| PE-LV-Enc Params=0.3B, Video Data=22M, Resolution=336, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 41 | — | — | — | — | — | — | — | |
| UNITEModel Size=7B2026.02 | 40.3 | 68.7 | — | — | — | 78.1 | — | — | |
| SigLIP2-g-optV-Enc Params=1.1B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 40.1 | — | — | — | — | — | — | — | |
| LanguageBindBackbone=CLIP-H/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 39.9 | 66.1 | — | — | — | 74.6 | — | — | |
| LanguageBindModality=T-V, Zero-shot=true2024.12 | 39.8 | — | — | — | — | — | — | — | |
| LanguageBindModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 39.8 | — | — | — | — | 76.2 | — | — | |
| LanguageBindModality=T-V, Zero-shot=true2026.02 | 39.8 | — | — | — | — | — | — | — | |
| LanguageBindZero-shot=true2025.07 | 39.8 | — | — | — | — | — | — | — | |
| LanguageBind (CLIP-H/14)Setting=ZS2026.05 | 39.8 | — | — | — | — | — | — | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 39.7 | 65.5 | — | — | — | 73.8 | — | — | |
| VideoMatch2021.10 | 38.7 | 72.9 | — | 2.4 | — | — | — | — | |
| UniME-V2Model Size=7B2026.02 | 38.7 | 61 | — | — | — | 69 | — | — | |
| ImageBindV-Enc Params=0.6B, Video Data=3M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 38.2 | — | — | — | — | — | — | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=3M, Evaluation Protocol=Full Tuning2023.10 | 38.1 | 65 | — | — | — | 73.6 | — | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=3M, Evaluation Protocol=Zero-shot2023.10 | 37.8 | 63.2 | — | — | — | 73.4 | — | — | |
| SigLIP2-L/16V-Enc Params=0.3B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 37.8 | — | — | — | — | — | — | — | |
| ALPROInput=8x224, Pretraining Parameters=5M, Tunable Parameters=245M, Training Protocol=full fine-tuning2023.05 | 35.9 | 67.5 | — | 3 | — | 78.8 | — | — | |
| TVTSv2Backbone=CLIP-L/14, Training Dataset Size=8.5M, Evaluation Protocol=Zero-shot2023.10 | 34.6 | 61.9 | — | — | — | 71.5 | — | — | |
| Frozen in TimeInput=32x224, Pretraining Parameters=5M, Tunable Parameters=180M, Training Protocol=full fine-tuning2023.05 | 34.6 | 65 | — | 3 | — | 74.7 | — | — | |
| TVTSv2Modality=T-V, Evaluation Protocol=Zero-shot2024.12 | 34.6 | — | — | — | — | 71.5 | — | — | |
| UMTBackbone=CLIP-L/14, Training Dataset Size=5M, Evaluation Protocol=Zero-shot2023.10 | 34 | 60.4 | — | — | — | 68.7 | — | — |