Text-to-Video Retrieval on VATEX (test)
78.5R@1VALOR_L
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| VALOR_L#Example=33.5M, Mod=V+A, Dual Softmax (+DSL)=true2023.04 | 78.5 | 97.1 | 98.7 | — | — | |
| VALOR_L#Example=33.5M, Mod=V+A, Dual Softmax (+DSL)=false2023.04 | 76.9 | 96.7 | 98.6 | — | — | |
| InternVideo#Example=147.6M, Mod=V, Dual Softmax (+DSL)=true2023.04 | 71.1 | — | — | — | — | |
| VidVec-ZSModel Size=7B, Evaluation Protocol=Zero-shot, Reranking=K=1002026.02 | 69.1 | 93.3 | 96.7 | — | — | |
| Side4Video (E/14)Protocol=Frozen backbone, Pretrain=LAION-2B, Backbone=ViT-E/142023.11 | 68.8 | 93.5 | 97 | 1 | 2.7 | |
| VidVec-OModel Size=7B, Optimization Data=60K text-only in-context pairs2026.02 | 68.2 | 93.6 | 96.8 | — | — | |
| Side4Video (L/14)Protocol=Frozen backbone, Pretrain=CLIP-400M, Backbone=ViT-L/142023.11 | 67.9 | 93.9 | 97.3 | 1 | 2.6 | |
| VALOR_B#Example=6.5M, Mod=V+A2023.04 | 67.5 | 94.1 | 97.4 | — | — | |
| Cap4Video2022.12 | 66.6 | 93.1 | 97 | 1 | 2.7 | |
| Cap4VideoProtocol=Full Fine-tuning, Pretrain=CLIP-400M2023.11 | 66.6 | 93.1 | 97 | 1 | 2.7 | |
| DCRMod=V2023.04 | 65.7 | 92.6 | 96.7 | — | — | |
| Side4Video (B/16)Protocol=Frozen backbone, Pretrain=CLIP-400M, Backbone=ViT-B/162023.11 | 61.7 | 91.5 | 96 | 1 | 3.1 | |
| LamRAModel Size=7B, Evaluation Protocol=Zero-shot2026.02 | 61.4 | 90.6 | 95.2 | — | — | |
| LamRAModel Size=7B, Training Scale=Large vision-text scale2026.02 | 61.4 | 90.6 | 95.2 | — | — | |
| UCOFIAMethod Category=CLIP-based Methods2023.09 | 61.1 | 90.5 | — | — | 3.4 | |
| TEFAL2023.07 | 61 | 90.4 | 95.3 | 1 | 3.8 | |
| X-Pool2023.07 | 60 | 90 | 95 | 1 | 3.8 | |
| GLCCL2026.05 | 60 | 89.2 | 94.6 | 1 | 5.4 | |
| TS2-NetRe-training=true2026.05 | 59.5 | 89.8 | 95 | 1 | 3.6 | |
| VALOR_E#Example=5.5M, Mod=V2023.04 | 59.4 | 90.5 | 95.4 | — | — | |
| CM AdapterProtocol=Frozen backbone, Pretrain=CLIP-400M2023.11 | 59.3 | 89.8 | 95.2 | — | 3.5 | |
| TS2-Netinverted softmax=false2022.07 | 59.1 | 90 | 95.2 | 1 | 3.5 | |
| TS2-Net2022.12 | 59.1 | 90 | 95.2 | 1 | 3.5 | |
| TS2-NetMethod Category=CLIP-based Methods2023.09 | 59.1 | 90 | — | — | 3.5 | |
| TS2-Net2023.07 | 59.1 | 90 | 95.2 | 1 | 3.5 | |
| TS2-NetProtocol=Full Fine-tuning, Pretrain=CLIP-400M2023.11 | 59.1 | 90 | 95.2 | 1 | 3.5 | |
| TS2-NetMod=V2023.04 | 59.1 | 90 | 95.2 | — | — | |
| X-CLIPBase=true, Re-training=true2026.05 | 59.1 | 88.9 | 94.2 | 1 | 3.9 | |
| QB-Norminverted softmax=true2022.07 | 58.8 | 88.3 | 93.8 | 1 | — | |
| QB-Norm2022.12 | 58.8 | 88.3 | 93.8 | 1 | — | |
| QB-Norm2026.05 | 58.8 | 88.3 | 93.8 | 1 | — | |
| CLIP4ClipRe-training=true2026.05 | 58.7 | 89.3 | 94.7 | 1 | 3.7 | |
| Side4Video (B/32)Protocol=Frozen backbone, Pretrain=CLIP-400M, Backbone=ViT-B/322023.11 | 58.1 | 89.2 | 94.8 | 1 | 3.7 | |
| ECLIPSEvariant=meanP†2023.07 | 57.8 | 88.4 | 94.3 | 1 | 4.3 | |
| MMRet-v1.5Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 57.7 | 87.5 | 93.5 | — | — | |
| MMRet-v1.5Model Size=7B, Training Scale=Large vision-text scale2026.02 | 57.7 | 87.5 | 93.5 | — | — | |
| CLIP2Videoinverted softmax=false2022.07 | 57.3 | 90 | 95.5 | 1 | 3.6 | |
| Clip2Video2022.12 | 57.3 | 90 | 95.5 | 1 | 3.6 | |
| CLIP2VideoProtocol=Full Fine-tuning, Pretrain=CLIP-400M2023.11 | 57.3 | 90 | 95.5 | 1 | 3.6 | |
| B3Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 57.3 | 86.5 | 92.3 | — | — | |
| B3Model Size=7B, Training Scale=Large vision-text scale2026.02 | 57.3 | 86.5 | 92.3 | — | — | |
| CLIP4Clipinverted softmax=false2022.07 | 55.9 | 89.2 | 95 | 1 | 3.9 | |
| CLIP4Clip2022.12 | 55.9 | 89.2 | 95 | 1 | 3.9 | |
| CLIP4ClipMethod Category=CLIP-based Methods2023.09 | 55.9 | 89.2 | — | — | 3.9 | |
| CLIP4Clipvariant=seqTransf2023.07 | 55.9 | 89.2 | 95 | 1 | 3.9 | |
| CLIP4ClipMod=V2023.04 | 55.9 | 89.2 | 95 | — | — | |
| CLIP4Clip (ViT)Protocol=Frozen backbone, Pretrain=CLIP-400M2023.11 | 55.7 | 87.6 | 93.8 | 1 | 4.2 | |
| VLM2VecModel Size=7B, Evaluation Protocol=Zero-shot2026.02 | 53.6 | 84.4 | 91 | — | — | |
| VLM2VecModel Size=7B, Training Scale=Large vision-text scale2026.02 | 53.6 | 84.4 | 91 | — | — | |
| VideoCoCazero-shot=true2022.12 | 53.2 | 83.3 | 90.1 | — | — | |
| VLM2Vec-V2Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 52.9 | 83.2 | 90.4 | — | — | |
| VLM2Vec-V2Model Size=7B, Training Scale=Large vision-text scale2026.02 | 52.9 | 83.2 | 90.4 | — | — | |
| UniME-V2Model Size=7B, Evaluation Protocol=Zero-shot2026.02 | 52 | 80.8 | 86.9 | — | — | |
| UniME-V2Model Size=7B, Training Scale=Large vision-text scale2026.02 | 52 | 80.8 | 86.9 | — | — | |
| VideoCoCa (w.o. videos)zero-shot=true, initialization=pretrained CoCa model without continued pretraining2022.12 | 50.7 | 81.3 | 88.5 | — | — | |
| InternVideozero-shot=true2022.12 | 49.5 | — | — | — | — | |
| CoCazero-shot=true2022.12 | 47.2 | 79 | 86.9 | — | — | |
| Support SetMethod Category=Non-CLIP Methods2023.09 | 45.9 | 82.4 | — | — | — | |
| UNITEModel Size=7B, Evaluation Protocol=Zero-shot2026.02 | 45.7 | 74 | 81 | — | — | |
| UNITEModel Size=7B, Training Scale=Large vision-text scale2026.02 | 45.7 | 74 | 81 | — | — | |
| SUPPORT2022.12 | 44.9 | 82.1 | 89.7 | 1 | — | |
| Support-set#Example=136M, Mod=V2023.04 | 44.9 | 82.1 | 89.7 | — | — | |
| SUPPORT2026.05 | 44.6 | 81.8 | 89.5 | 1 | — | |
| CLIPinverted softmax=false2022.07 | 39.7 | 72.3 | 82.2 | 2 | 12.8 | |
| CLIP2022.12 | 39.7 | 72.3 | 82.2 | 2 | 12.8 | |
| HGRinverted softmax=false2022.07 | 35.1 | 73.5 | 83.5 | 2 | — | |
| HGR2022.12 | 35.1 | 73.5 | 83.5 | 2 | — | |
| HGR2026.05 | 35.1 | 73.5 | 83.5 | 2 | — | |
| Dual Enc.inverted softmax=false2022.07 | 31.1 | 67.5 | 78.9 | 3 | — |