Video Question Answering on MSRVTT
66.7AccuracyLVLM
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| LVLMModel Scale=13B2026.01 | 66.7 | — | — | — | — | — | |
| FMVR-LLaVA#Vision Tokens=28802026.03 | 65.2 | — | — | — | — | — | |
| LVLMModel Scale=7B2026.01 | 65 | — | — | — | — | — | |
| FMVR-LLaVA#Vision Tokens=7202026.03 | 64.8 | — | — | — | — | — | |
| PLLaVAModel Scale=13B2026.01 | 63.2 | — | — | — | — | — | |
| ST-LLM2026.01 | 63.2 | — | — | — | — | — | |
| FMVR-LLaVA#Vision Tokens=1802026.03 | 62.5 | — | — | — | — | — | |
| PLLaVAModel Scale=7B2026.01 | 62 | — | — | — | — | — | |
| Video-LLaVA2026.01 | 59.2 | — | — | — | — | — | |
| Video-LLaVA2026.03 | 59.2 | — | — | 100 | — | — | |
| Video-LLAVA#Vision Tokens=20482026.03 | 59.2 | — | — | — | — | — | |
| LLaMA-VID2026.01 | 58.9 | — | — | — | — | — | |
| FMVR-LLaVA#Vision Tokens=452026.03 | 58.3 | — | — | — | — | — | |
| PyramidDropTokens=960, Token Reduction (%)=53.12%2026.02 | 58 | — | — | 100.7 | — | — | |
| LLaMA-VID#Vision Tokens=1fps×22026.03 | 57.7 | — | — | — | — | — | |
| Video-LLaVAtokens_kept=all2026.04 | 57.5 | — | 3.5 | — | — | — | |
| BT-Adapter#Vision Tokens=~2602026.03 | 57 | — | — | — | — | — | |
| Video-LLaVABackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 56.8 | — | 3.48 | — | — | — | |
| VanillaBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 56.7 | — | — | — | — | — | |
| Video-LLaVATokens=2048, Token Reduction (%)=0%2026.02 | 56.7 | — | — | 100 | — | — | |
| VanillaBase Model=Video-LLaVA-7B, Token Reduction Rate=0.0%2025.05 | 56.7 | — | — | — | — | — | |
| MI-Prunertokens_kept=2272026.04 | 56.4 | — | 3.46 | — | — | — | |
| VisionTrimBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 55.8 | — | — | — | — | — | |
| DUET-VLM (C)Tokens=960, Token Reduction (%)=53.12%2026.02 | 55.6 | — | — | 100.8 | — | — | |
| VisPruner#Vision Tokens=2272026.03 | 55.6 | — | — | — | — | — | |
| VisPrunertokens_kept=2272026.04 | 55.6 | — | 3.45 | — | — | — | |
| MI-Prunertokens_kept=1142026.04 | 55.3 | — | 3.49 | — | — | — | |
| DUET-VLM (C)Tokens=136, Token Reduction (%)=93.4%2026.02 | 55.2 | — | — | 97.6 | — | — | |
| MoB (with η-prior)Base Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 55.2 | — | — | — | — | — | |
| Uniform SamplingBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 54.9 | — | — | — | — | — | |
| Chat-UniVi2026.01 | 54.6 | — | — | — | — | — | |
| VisionDropBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 54.6 | — | 3.42 | — | — | — | |
| TwigVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 54.6 | — | — | — | — | — | |
| VanillaVisual Tokens=20482026.06 | 54.49 | — | — | — | — | — | |
| VideoChat22026.01 | 54.1 | — | — | — | — | — | |
| VisPrunertokens_kept=1142026.04 | 54.1 | — | 3.41 | — | — | — | |
| VisionZipBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 54 | — | 3.41 | — | — | — | |
| PRUNESID2026.03 | 53.3 | — | — | 95.5 | — | — | |
| FastVtokens_kept=2272026.04 | 53 | — | 3.4 | — | — | — | |
| MovieChat#Vision Tokens=655362026.03 | 52.7 | — | — | — | — | — | |
| FMVR-LLaVA#Vision Tokens=52026.03 | 52.4 | — | — | — | — | — | |
| FastVtokens_kept=1142026.04 | 52.4 | — | 3.39 | — | — | — | |
| VisionZipTokens=136, Token Reduction (%)=93.4%2026.02 | 52.1 | — | — | 91 | — | — | |
| VisionZipBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 52.1 | — | — | — | — | — | |
| VisionZip2026.03 | 52.1 | — | — | 93.2 | — | — | |
| VisionZip#Vision Tokens=1362026.03 | 52.1 | — | — | — | — | — | |
| CLASPBackbone=Video-LLaVA-7B2026.04 | 51.58 | — | — | — | 52.95 | — | |
| Upper BoundBackbone=Video-LLaVA-7B2026.04 | 51.28 | — | — | — | 52.23 | — | |
| VALLEY2026.01 | 50.8 | — | — | — | — | — | |
| MiCo2024.06 | 50.4 | — | — | — | — | — | |
| GPT4Video2026.01 | 49.8 | — | — | — | — | — | |
| SparseVLMBackbone=Video-LLaVA-7B2026.04 | 49.69 | — | — | — | 51.22 | — | |
| Video-ChatGPT2026.01 | 49.3 | — | — | — | — | — | |
| Video-ChatGPT#Vision Tokens=~3602026.03 | 49.3 | — | — | — | — | — | |
| SOTA2024.06 | 49.2 | — | — | — | — | — | |
| MA-LMM2026.01 | 48.5 | — | — | — | — | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=Gem2026.06 | 48.3 | — | — | — | — | 2.36 | |
| SparseVLMStrategy=Merging, Evaluator=Gem2026.06 | 48 | — | — | — | — | 2.38 | |
| DCP-PruneVisual Tokens=1282026.06 | 47.7 | — | — | — | — | — | |
| Video-LLaVAStrategy=Vanilla, Evaluator=Gem2026.06 | 47.5 | — | — | — | — | 2.32 | |
| Brote-IM-XXLLLM Backbone=FlanT5, #Param LLM=11B2024.02 | 45.94 | — | — | — | — | — | |
| Co-Tokenization2023.10 | 45.7 | — | — | — | — | — | |
| Brote-EX-XXLLLM Backbone=FlanT5, #Param LLM=11B2024.02 | 45.24 | — | — | — | — | — | |
| Brote-IM-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 45.08 | — | — | — | — | — | |
| FastVBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 45 | — | 3.14 | — | — | — | |
| VideoChat#Vision Tokens=5122026.03 | 45 | — | — | — | — | — | |
| SCOPEVisual Tokens=1282026.06 | 44.81 | — | — | — | — | — | |
| InternVideo2023.10 | 44.8 | — | — | — | — | — | |
| VIOLETv22023.10 | 44.5 | — | — | — | — | — | |
| InternVideovariant=w/o decoder2023.10 | 44.2 | — | — | — | — | — | |
| OmniVL2023.10 | 44.1 | — | — | — | — | — | |
| InternVideobackbone=ViT2023.10 | 44.1 | — | — | — | — | — | |
| VIOLET2023.10 | 43.9 | — | — | — | — | — | |
| LLaMA Adapter#Vision Tokens=12802026.03 | 43.8 | — | — | — | — | — | |
| Brote-EX-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 43.14 | — | — | — | — | — | |
| MERLOT2023.10 | 43.1 | — | — | — | — | — | |
| All-in-one2023.10 | 42.9 | — | — | — | — | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=GPT2026.06 | 42.9 | — | — | — | — | 2.66 | |
| Video-LLaVAStrategy=Vanilla, Evaluator=GPT2026.06 | 42.7 | — | — | — | — | 2.69 | |
| MMICL-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 42.36 | — | — | — | — | — | |
| ALPRO2023.10 | 42.1 | — | — | — | — | — | |
| SparseVLMStrategy=Merging, Evaluator=GPT2026.06 | 41.9 | — | — | — | — | 2.63 | |
| Just Ask2023.10 | 41.8 | — | — | — | — | — | |
| SCOPEVisual Tokens=642026.06 | 40.81 | — | — | — | — | — | |
| MMICL-XXLLLM Backbone=FlanT5, #Param LLM=11B2024.02 | 39.46 | — | — | — | — | — | |
| PriorTRStrategy=Pruning, Evaluator=Gem2026.06 | 39.4 | — | — | — | — | 1.95 | |
| DCP-PruneVisual Tokens=642026.06 | 37.59 | — | — | — | — | — | |
| FlowCutVisual Tokens=1282026.06 | 37.45 | — | — | — | — | — | |
| ClipBERT2023.10 | 37.4 | — | — | — | — | — | |
| PriorTRStrategy=Pruning, Evaluator=GPT2026.06 | 35.1 | — | — | — | — | 2.35 | |
| FastVStrategy=Pruning, Evaluator=Gem2026.06 | 34.3 | — | — | — | — | 1.69 | |
| Emu2-Chat2023.12 | 31.4 | — | — | — | — | — | |
| EMU-2LLM Backbone=LLAMA, #Param LLM=33B2024.02 | 31.4 | — | — | — | — | — | |
| FastVStrategy=Pruning, Evaluator=GPT2026.06 | 31.4 | — | — | — | — | 2.19 | |
| FlowCutVisual Tokens=642026.06 | 31.39 | — | — | — | — | — | |
| SparseVLMTokens=136, Token Reduction (%)=93.4%2026.02 | 31 | — | — | 82.4 | — | — | |
| SparseVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 31 | — | — | — | — | — | |
| SparseVLM2026.03 | 31 | — | — | 86.5 | — | — | |
| SparseVLM#Vision Tokens=1982026.03 | 31 | — | — | — | — | — | |
| Video-LLAMA#Vision Tokens=10242026.03 | 29.6 | — | — | — | — | — |