Video-to-Text Retrieval on ActivityNet (test)
71.9R@1VidVec
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| VidVec2026.02 | 71.9 | 90.8 | 95.8 | — | — | — | — | |
| InternVideo2-6BTraining Protocol=Fine-tuned on ActivityNet2026.02 | 69.7 | — | — | — | — | — | — | |
| UMT-LTraining Protocol=Fine-tuned on ActivityNet2026.02 | 64.4 | — | — | — | — | — | — | |
| LamRAModel Category=Multimodal LLM Embedders2026.02 | 58.7 | 84.8 | 92.5 | — | — | — | — | |
| InternVideo2-6BModel Category=Video Foundation Models2026.02 | 56.5 | 82.8 | 90.3 | — | — | — | — | |
| MMRet-v1.5Model Category=Multimodal LLM Embedders2026.02 | 52.7 | 77.8 | 86.8 | — | — | — | — | |
| PE-Core-GModel Category=Video Foundation Models2026.02 | 51.2 | — | — | — | — | — | — | |
| VideoPrism-gModel Category=Video Foundation Models2026.02 | 50.3 | 77.1 | — | — | — | — | — | |
| RAPType=Adapter, Frozen visual encoder=true2024.05 | 48.2 | 76.5 | 86.2 | — | 6.8 | — | — | |
| ViCLIPTraining Protocol=Fine-tuned on ActivityNet2026.02 | 48.1 | — | — | — | — | — | — | |
| X-CLIPBackbone=ViT-B/162022.07 | 46.4 | 75.9 | — | — | 6.4 | — | — | |
| CLIP4ClipBackbone=ViT-B/16, Aggregation Strategy=MeanP2022.07 | 44.1 | 74 | — | — | 6.5 | — | — | |
| CLIP4ClipBackbone=ViT-B/16, Aggregation Strategy=seqTransf2022.07 | 44.1 | 75.2 | — | — | 6.4 | — | — | |
| X-CLIPBackbone=ViT-B/322022.07 | 43.9 | 73.9 | — | — | 7.6 | — | — | |
| CLIP4Clip-seqLSTMTrainD=W+A, E2E=false2021.04 | 42.6 | 73.4 | 85.6 | 2 | 6.7 | — | — | |
| CLIP4Clip-meanPTrainD=W+A, E2E=false2021.04 | 42.5 | 74.1 | 85.8 | 2 | 6.6 | — | — | |
| CLIP4ClipBackbone=ViT-B/32, Aggregation Strategy=MeanP2022.07 | 42.5 | 74.1 | — | — | 6.6 | — | — | |
| CLIP4Clip-meanPBackbone=CLIP (ViT-B/32), # Params (M)=123.542025.06 | 42.5 | 74.1 | 85.8 | — | 6.6 | — | 202.4 | |
| CLIP4ClipType=Fine-tune, Frozen visual encoder=false2024.05 | 41.9 | 72.2 | 84.6 | — | 7.3 | — | — | |
| RAPType=Adapter, Frozen visual encoder=false2024.05 | 41.9 | 73 | 84 | — | 7.5 | — | — | |
| DiscoVLABackbone=CLIP (ViT-B/32), # Params (M)=0.562025.06 | 41.8 | 72.8 | 84.7 | — | 6.9 | — | 199.3 | |
| CLIP4ClipTraining Protocol=Fine-tuned on ActivityNet2026.02 | 41.6 | — | — | — | — | — | — | |
| CLIP4Clip-seqTransfTrainD=W+A, E2E=false2021.04 | 41.4 | 73.7 | 85.3 | 2 | 6.7 | — | — | |
| CLIP4ClipBackbone=ViT-B/32, Aggregation Strategy=seqTransf2022.07 | 41.4 | 73.7 | — | — | 6.7 | — | — | |
| UMT-LModel Category=Video Foundation Models2026.02 | 40.7 | 67.6 | 78.6 | — | — | — | — | |
| VLM2VecModel Category=Multimodal LLM Embedders2026.02 | 40.4 | 59.2 | 66.2 | — | — | — | — | |
| B3Model Category=Multimodal LLM Embedders2026.02 | 39.2 | 57.4 | 65.3 | — | — | — | — | |
| VLM2Vec-V2Model Category=Multimodal LLM Embedders2026.02 | 38.8 | 58 | 65.6 | — | — | — | — | |
| UniME-V2Model Category=Multimodal LLM Embedders2026.02 | 38.5 | 57.2 | 64.5 | — | — | — | — | |
| VoPF+PBackbone=CLIP (ViT-B/32), # Params (M)=0.42025.06 | 36.3 | 65.9 | 79.2 | — | 10.1 | — | 181.4 | |
| SSFType=Adapter2024.05 | 36.2 | 66.9 | 79 | — | 10.4 | — | — | |
| VoPF+CBackbone=CLIP (ViT-B/32), # Params (M)=14.102025.06 | 35.6 | 65.9 | 77.8 | — | 10.4 | — | 179.3 | |
| VoPPType=Prompt2024.05 | 34.8 | 65 | 78.2 | — | 10.7 | — | — | |
| VoPCType=Prompt2024.05 | 34.2 | 64.8 | 78.4 | — | 10.7 | — | — | |
| UNITEModel Category=Multimodal LLM Embedders2026.02 | 31.4 | 47.6 | 55 | — | — | — | — | |
| InternVideo-LModel Category=Video Foundation Models2026.02 | 31.4 | — | — | — | — | — | — | |
| LORAType=Adapter2024.05 | 30.8 | 60 | 73.2 | — | 15.2 | — | — | |
| ST-AdapterType=Adapter2024.05 | 29.7 | 58.8 | 73.1 | — | 15.5 | — | — | |
| Support Set2022.06 | 29.2 | 61.6 | — | — | — | — | — | |
| CoOpType=Prompt2024.05 | 29 | 57.6 | 72.4 | — | 14 | — | — | |
| MMTTrainD=H+A, E2E=false2021.04 | 28.9 | 61.1 | — | 4 | 17.1 | — | — | |
| MMT2022.07 | 28.9 | 61.1 | — | — | 17.1 | — | — | |
| SSBTrainD=H+A, E2E=false2021.04 | 28.7 | 60.8 | — | 2 | — | — | — | |
| SSB2022.07 | 28.7 | 60.8 | — | — | — | — | — | |
| VPTType=Prompt2024.05 | 28.4 | 56.7 | 69.4 | — | 19.7 | — | — | |
| ViCLIPModel Category=Video Foundation Models2026.02 | 24 | — | — | — | — | — | — | |
| TT-CE+TrainD=A, E2E=false2021.04 | 23 | 56.1 | — | 4 | — | — | — | |
| TT-CE+2022.07 | 23 | 56.1 | — | — | — | — | — | |
| ClipBERT2022.06 | 21.3 | 49 | — | — | — | — | — | |
| ActivityNet modelTrained On=ActivityNet2021.05 | 19.1 | 48.1 | 61.2 | — | — | 32.5 | — | |
| CLIP4Clip-tightTransfTrainD=W+A, E2E=true2021.04 | 18.9 | 49.6 | 65.8 | 6 | 16.3 | — | — | |
| HSETrainD=A, E2E=false2021.04 | 18.7 | 48.1 | — | — | — | — | — | |
| HSE2022.07 | 18.7 | 48.1 | — | — | — | — | — | |
| CETrainD=A, E2E=false2021.04 | 17.7 | 46.6 | — | 6 | 24.4 | — | — | |
| ATP2022.06 | 17.7 | 41.8 | — | — | — | — | — | |
| CE2022.07 | 17.7 | 46.6 | — | — | — | — | — | |
| CLIP4ClipType=Fine-tune, Frozen visual encoder=true2024.05 | 17.7 | 40.7 | 54.1 | — | 42.5 | — | — | |
| S-MiT modelTrained On=S-MiT2021.05 | 17.6 | 41.6 | 53.8 | — | — | 29.2 | — | |
| FSETrainD=A, E2E=false2021.04 | 16.7 | 43.1 | — | 7 | — | — | — | |
| FSE2022.07 | 16.7 | 43.1 | — | — | — | — | — | |
| Vatex modelTrained On=Vatex2021.05 | 15.6 | 39.4 | 51.7 | — | — | 27.1 | — | |
| CLIPinput_format=single-frame2022.06 | 12.5 | 30.3 | — | — | — | — | — | |
| MSR-VTT modelTrained On=MSR-VTT2021.05 | 9.9 | 28.3 | 39.7 | — | — | 19.6 | — |