Video-to-Text Retrieval on ActivityNet
58.2R@1VideoMatch
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| VideoMatch2021.10 | 58.2 | 88.1 | 1 | — | — | — | — | |
| HSE2021.10 | 44.2 | 76.7 | 2 | — | — | — | — | |
| Dense full2021.10 | 18 | 36 | 32 | — | — | — | — | |
| FSE2021.10 | 16.7 | 43.1 | 7.3 | — | — | — | — | |
| No Context2021.10 | 7 | 18 | 56 | — | — | — | — | |
| InternVideo2s2-6BFinetuning=true2024.03 | 0.697 | — | — | — | — | — | — | |
| MAVISMethod Category=Agentic Methods2026.06 | 0.6915 | 0.924 | — | — | — | 0.968 | — | |
| MERLIN (Round 5)Method Category=Agentic Methods2026.06 | 0.6844 | 0.9195 | — | — | — | 0.9663 | — | |
| GRAM ModelModality=T-VA2024.12 | 0.669 | — | — | — | — | 95.4 | — | |
| GRAM ModelModality=T-VA, Finetuning=true2024.12 | 0.669 | — | — | — | — | — | — | |
| VASTModality=T-VA2024.12 | 0.667 | — | — | — | — | 95.3 | — | |
| VASTModality=T-VA, Finetuning=true2024.12 | 0.667 | — | — | — | — | — | — | |
| PMRLsetting=finetuning2025.07 | 0.664 | — | — | — | — | — | — | |
| MERLIN (Round 3)Method Category=Agentic Methods2026.06 | 0.6605 | 0.9097 | — | — | — | 0.9554 | — | |
| VASTsetting=finetuning2025.07 | 0.654 | — | — | — | — | — | — | |
| GRAMsetting=finetuning2025.07 | 0.65 | — | — | — | — | — | — | |
| UMT-LModality=T-V, Finetuning and evaluation frames=122024.12 | 0.646 | — | — | — | — | — | — | |
| GRAM ModelModality=T-V2024.12 | 0.646 | — | — | — | — | 95.1 | — | |
| GRAM ModelModality=T-V, Finetuning=true2024.12 | 0.646 | — | — | — | — | — | — | |
| UMT-LFinetuning=true2024.03 | 0.644 | — | — | — | — | — | — | |
| UMT-LModality=T-V, Finetuning=true, Evaluation frames=122024.12 | 0.644 | — | — | — | — | — | — | |
| UMT-Lsetting=finetuning, evaluation_frames=122025.07 | 0.644 | — | — | — | — | — | — | |
| InternVideo2-6BMethod Category=Large-scale Video Foundation Models2026.06 | 0.632 | 0.856 | — | — | — | 0.925 | — | |
| InternVideoBackbone=ViT-L/142022.12 | 0.628 | — | — | — | — | — | — | |
| InternVideo-LModality=T-V, Finetuning=true, Evaluation frames=122024.12 | 0.628 | — | — | — | — | — | — | |
| InternVideo-Lsetting=finetuning, evaluation_frames=122025.07 | 0.628 | — | — | — | — | — | — | |
| MERLIN (Round 0)Method Category=Agentic Methods2026.06 | 0.5658 | 0.8477 | — | — | — | 0.9173 | — | |
| Marengo-2.6Method Category=Large-scale Video Foundation Models2026.06 | 0.5536 | 0.8255 | — | — | — | — | — | |
| VASTMethod Category=Large-scale Video Foundation Models2026.06 | 0.552 | 0.825 | — | — | — | 0.906 | — | |
| MoVADSL post-processing=true2026.07 | 0.544 | 0.799 | 1 | 5.7 | — | 0.886 | — | |
| VideoPrism-gMethod Category=Large-scale Video Foundation Models2026.06 | 0.527 | 0.794 | — | — | — | — | — | |
| UniAlign*Modality=T-VA, Zero-shot=true, Tuple-level losses=false2026.02 | 0.525 | — | — | — | — | — | — | |
| MAMABase Model=CLIP-ViP2026.01 | 0.523 | 0.808 | — | — | — | 0.901 | — | |
| UniAlignModality=T-VA, Zero-shot=true, Tuple-level losses=true2026.02 | 0.517 | — | — | — | — | — | — | |
| GRAMModality=T-V, Zero-shot=true2024.12 | 0.509 | — | — | — | — | — | — | |
| GRAM ModelModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 0.509 | — | — | — | — | 0.854 | — | |
| Vid2SeqBase Model=CLIP-ViP2026.01 | 0.509 | 0.795 | — | — | — | 0.896 | — | |
| EMCL-NetPre-trained weights=CLIP (ViT-B/32), Inverted softmax=true2022.11 | 0.506 | 0.789 | 1 | — | 0.984 | — | — | |
| GRAMModality=T-VA, Zero-shot=true2024.12 | 0.504 | — | — | — | — | — | — | |
| GRAM ModelModality=T-VA, Evaluation Protocol=Zero-shot2024.12 | 0.504 | — | — | — | — | 0.858 | — | |
| GRAMModality=T-VA, Zero-shot=true2026.02 | 0.504 | — | — | — | — | — | — | |
| LaViLaBase Model=CLIP-ViP2026.01 | 0.503 | 0.787 | — | — | — | 0.884 | — | |
| CLIP-ViP2026.01 | 0.502 | 0.783 | — | — | — | 0.875 | — | |
| CAMoE2021.09 | 0.499 | 0.774 | — | — | — | — | — | |
| PMRLZero-shot=true2025.07 | 0.496 | — | — | — | — | — | — | |
| Cap4VideoMethod Category=Supervised / Fine-tuned2026.06 | 0.492 | 0.773 | — | — | — | 0.851 | — | |
| VASTZero-shot=true2025.07 | 0.488 | — | — | — | — | — | — | |
| T-MASSMethod Category=Supervised / Fine-tuned2026.06 | 0.485 | 0.764 | — | — | — | 0.842 | — | |
| GRAMZero-shot=true2025.07 | 0.483 | — | — | — | — | — | — | |
| ViCLIPFinetuning=true2024.03 | 0.481 | — | — | — | — | — | — | |
| ViCLIPModality=T-V2024.12 | 0.481 | — | — | — | — | — | — | |
| ViCLIPModality=T-V, Finetuning=true2024.12 | 0.481 | — | — | — | — | — | — | |
| ViCLIPsetting=finetuning2025.07 | 0.481 | — | — | — | — | — | — | |
| VideoPrism-bModality=T-V, Zero-shot=true2024.12 | 0.479 | — | — | — | — | — | — | |
| VideoPrism-bModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 0.479 | — | — | — | — | — | — | |
| VideoPrism-bModality=T-V, Zero-shot=true2026.02 | 0.479 | — | — | — | — | — | — | |
| VideoPrism-bZero-shot=true2025.07 | 0.479 | — | — | — | — | — | — | |
| VindLU2026.01 | 0.471 | 0.775 | — | — | — | 0.866 | — | |
| VASTModality=T-VA, Zero-shot=true2024.12 | 0.468 | — | — | — | — | — | — | |
| VASTModality=T-VA, Evaluation Protocol=Zero-shot2024.12 | 0.468 | — | — | — | — | 0.774 | — | |
| VASTModality=T-VA, Zero-shot=true2026.02 | 0.468 | — | — | — | — | — | — | |
| MoVADSL post-processing=false2026.07 | 0.467 | 0.766 | 2 | 6.3 | — | 0.868 | — | |
| X-CLIP2022.12 | 0.464 | — | — | — | — | — | — | |
| X-CLIPMethod Category=Supervised / Fine-tuned2026.06 | 0.464 | 0.759 | — | — | — | 0.845 | — | |
| ProST2026.07 | 0.437 | 0.739 | 2 | 7 | — | 0.847 | — | |
| DGL2026.07 | 0.434 | 0.736 | 2 | 7.9 | — | 0.851 | — | |
| CLIP4Clip2026.07 | 0.429 | 0.753 | 2 | 6.4 | — | 0.866 | — | |
| EMCL-NetPre-trained weights=CLIP (ViT-B/32), Inverted softmax=false2022.11 | 0.427 | 0.74 | 2 | — | 0.983 | — | — | |
| DRL2026.07 | 0.427 | 0.738 | 2 | 7.7 | — | 0.845 | — | |
| CLIP4Clip2026.01 | 0.426 | 0.734 | — | — | — | 0.856 | — | |
| CLIP4ClipPre-trained weights=CLIP (ViT-B/32), Inverted softmax=false2022.11 | 0.425 | 0.741 | 2 | — | 0.981 | — | — | |
| DRL2026.01 | 0.422 | 0.74 | — | — | — | 0.862 | — | |
| TeachCLIPMethod Category=Supervised / Fine-tuned2026.06 | 0.422 | 0.727 | — | — | — | 0.84 | — | |
| X-CLIP2026.07 | 0.422 | 0.746 | 2 | 6.9 | — | 0.855 | — | |
| CLIP4Clip2022.12 | 0.416 | — | — | — | — | — | — | |
| CLIP4ClipFinetuning=true2024.03 | 0.416 | — | — | — | — | — | — | |
| CLIP4ClipModality=T-V2024.12 | 0.416 | — | — | — | — | — | — | |
| CLIP4ClipModality=T-V, Finetuning=true2024.12 | 0.416 | — | — | — | — | — | — | |
| CLIP4Clipsetting=finetuning2025.07 | 0.416 | — | — | — | — | — | — | |
| InternVideo2026.07 | 0.416 | 0.738 | 2 | 7.1 | — | 0.85 | — | |
| LanguageBindBackbone=CLIP-H/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 0.41 | 0.684 | — | — | — | 0.8 | — | |
| LanguageBind-HMethod Category=Large-scale Video Foundation Models2026.06 | 0.41 | 0.684 | — | — | — | 0.808 | — | |
| DiCoSA2026.07 | 0.406 | 0.718 | 2 | 7.7 | — | 0.838 | — | |
| CLIP4ClipMethod Category=Supervised / Fine-tuned2026.06 | 0.405 | 0.724 | — | — | — | 0.801 | — | |
| UMT-LModality=T-V, Zero-shot=true2024.12 | 0.394 | — | — | — | — | — | — | |
| UMT-LModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 0.394 | — | — | — | — | — | — | |
| UMT-LModality=T-V, Zero-shot=true2026.02 | 0.394 | — | — | — | — | — | — | |
| UMT-LZero-shot=true2025.07 | 0.394 | — | — | — | — | — | — | |
| LanguageBindModality=T-V, Zero-shot=true2024.12 | 0.391 | — | — | — | — | — | — | |
| LanguageBindModality=T-V, Evaluation Protocol=Zero-shot2024.12 | 0.391 | — | — | — | — | 0.811 | — | |
| LanguageBindModality=T-V, Zero-shot=true2026.02 | 0.391 | — | — | — | — | — | — | |
| LanguageBindZero-shot=true2025.07 | 0.391 | — | — | — | — | — | — | |
| FullParams (M)=119.8 (100%)2022.11 | 0.389 | 0.701 | 2 | 8.4 | — | 0.819 | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=10M, Evaluation Protocol=Full Tuning2023.10 | 0.384 | 0.666 | — | — | — | 0.779 | — | |
| VideoCLIP-XL2026.07 | 0.377 | 0.682 | 2 | 10.1 | — | 0.811 | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=3M, Evaluation Protocol=Full Tuning2023.10 | 0.369 | 0.651 | — | — | — | 0.772 | — | |
| VoPF+PParams (M)=0.4 (0.328%)2022.11 | 0.363 | 0.659 | 3 | 10.1 | — | 0.792 | — | |
| VoPF+CParams (M)=14.1 (11.785%)2022.11 | 0.356 | 0.659 | 3 | 10.4 | — | 0.778 | — | |
| VoPFParams (M)=0.1 (0.103%)2022.11 | 0.355 | 0.651 | 3 | 10.2 | — | 0.774 | — | |
| LanguageBindBackbone=CLIP-L/14, Training Dataset Size=3M, Evaluation Protocol=Zero-shot2023.10 | 0.351 | 0.634 | — | — | — | 0.766 | — |