Text-to-Video Retrieval on ActivityNet Captions
73R@1VidLA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VidLABackbone=CLIP-ViT-B/16, dual-softmax inference=true2024.03 | 73 | 89.9 | 93.6 | — | |
| VidLABackbone=CLIP-ViT-B/32, dual-softmax inference=true2024.03 | 69.2 | 88.2 | 93.3 | — | |
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 66.5 | — | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 65.7 | — | — | — | |
| PEAV-LV-Enc Params=0.5B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 65.4 | — | — | — | |
| VidLABackbone=CLIP-ViT-B/162024.03 | 65.2 | 87.4 | 92.8 | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=30*, Zero-shot Protocol=true2025.12 | 64.8 | — | — | — | |
| PEAV-BV-Enc Params=0.4B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 64 | — | — | — | |
| PEAV-SV-Enc Params=0.3B, Video Data=124M, Resolution=336, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 63.4 | — | — | — | |
| InternVideo(ViT-L)Backbone=ViT-L, dual-softmax inference=true2024.03 | 62.2 | 85.9 | 93.2 | — | |
| CLIPVIPBackbone=CLIP-ViT-B/16, dual-softmax inference=true2024.03 | 61.4 | 85.7 | 92.6 | — | |
| VidLABackbone=CLIP-ViT-B/322024.03 | 61.3 | 84.8 | 91.3 | — | |
| InternVideo2V-Enc Params=1.0B, Video Data=102M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 60.4 | — | — | — | |
| CLIPVIPBackbone=CLIP-ViT-B/32, dual-softmax inference=true2024.03 | 59.1 | 83.9 | 91.3 | — | |
| UMTtwo-stage candidate re-ranking=true2024.03 | 58.3 | 83.9 | 91.5 | — | |
| VINDLUtwo-stage candidate re-ranking=true2024.03 | 55 | 81.4 | 89.7 | — | |
| PE-GV-Enc Params=1.9B, Video Data=22M, Resolution=448, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 54.7 | — | — | — | |
| RTQVideo-language pretraining (PT)=false2023.12 | 53.5 | 81.4 | 91.9 | 1 | |
| CLIP-ViPVideo-language pretraining (PT)=true2023.12 | 53.4 | 81.4 | 90 | 1 | |
| CLIPVIPBackbone=CLIP-ViT-B/162024.03 | 53.4 | 81.4 | 90 | — | |
| CLIPVIPBackbone=CLIP-ViT-B/322024.03 | 51.1 | 78.4 | 88.3 | — | |
| CAMOEBackbone=CLIP-ViT-B/32, dual-softmax inference=true2024.03 | 51 | 77.7 | — | — | |
| HiTeAVideo-language pretraining (PT)=true2023.12 | 49.7 | 77.1 | 86.7 | — | |
| LanguageBindV-Enc Params=0.3B, Video Data=10M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 48 | — | — | — | |
| SINGULARITY#PT=17M, #Train Frame=12022.06 | 47.1 | 75.5 | 85.5 | — | |
| PE-LV-Enc Params=0.3B, Video Data=22M, Resolution=336, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 46.4 | — | — | — | |
| CenterCLIPVideo-language pretraining (PT)=false2023.12 | 46.2 | 77 | 87.6 | 2 | |
| DRLBackbone=CLIP-ViT-B/162024.03 | 46.2 | 77.3 | 88.2 | — | |
| PIDROBackbone=CLIP-ViT-B/32, dual-softmax inference=true2024.03 | 44.9 | 74.5 | 86.1 | — | |
| DRLBackbone=CLIP-ViT-B/322024.03 | 44.2 | 74.5 | 86.1 | — | |
| CLIP2TVBackbone=CLIP-ViT-B/322024.03 | 44.1 | 75.2 | — | — | |
| CenterCLIPBackbone=CLIP-ViT-B/322024.03 | 43.9 | 74.6 | 85.8 | — | |
| SINGULARITY#PT=5M, #Train Frame=12022.06 | 43 | 70.6 | 81.3 | — | |
| UMT-LV-Enc Params=0.3B, Video Data=25M, Resolution=224, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 41.9 | — | — | — | |
| CLIP4Clip#PT=400M, #Train Frame=642022.06 | 40.5 | 72.4 | 98.2 | — | |
| CLIP4ClipBackbone=CLIP-ViT-B/322024.03 | 40.5 | 72.4 | — | — | |
| SigLIP2-g-optV-Enc Params=1.1B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 38.3 | — | — | — | |
| ImageBindV-Enc Params=0.6B, Video Data=3M, Resolution=224, Frame/ fps=16, Zero-shot Protocol=true2025.12 | 36.6 | — | — | — | |
| SigLIP2-L/16V-Enc Params=0.3B, Resolution=384, Frame/ fps=8, Zero-shot Protocol=true2025.12 | 35.9 | — | — | — | |
| VideoCoCaprotocol=zero-shot2022.12 | 34.5 | 63.2 | 76.6 | — | |
| VideoCoCazero-shot=true2022.12 | 34.5 | 63.2 | 76.6 | — | |
| VideoCoCaprotocol=zero-shot, continued pretraining=false2022.12 | 32.2 | 61 | 74.6 | — | |
| VideoCoCa (w.o. videos)zero-shot=true, initialization=pretrained CoCa model without continued pretraining2022.12 | 32.2 | 61 | 74.6 | — | |
| InternVideoprotocol=zero-shot2022.12 | 30.7 | — | — | — | |
| InternVideozero-shot=true2022.12 | 30.7 | — | — | — | |
| SINGULARITYprotocol=zero-shot2022.12 | 30.6 | 55.6 | 66.9 | — | |
| SINGULARITYzero-shot=true2022.12 | 30.6 | 55.6 | 66.9 | — | |
| Support Set2024.03 | 29.2 | 61.6 | — | — | |
| HD-VILA2024.03 | 28.5 | 57.4 | — | — | |
| CoCaprotocol=zero-shot2022.12 | 28.5 | 58.4 | 70.5 | — | |
| CoCazero-shot=true2022.12 | 28.5 | 58.4 | 70.5 | — | |
| All-in-one#PT=138M, #Train Frame=92022.06 | 22.4 | 53.7 | 67.7 | — | |
| All-in-One2024.03 | 22.4 | 53.7 | 67.7 | — | |
| ClipBERT#PT=0.2M, #Train Frame=82022.06 | 21.3 | 49 | 63.5 | — | |
| ClipBERTVideo-language pretraining (PT)=false2023.12 | 21.3 | 49 | 63.5 | 6 | |
| ClipBERT2024.03 | 21.3 | 49 | 63.5 | — |