Video Question Answering on MSVD
79.5AccuracyLVLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LVLMModel Scale=13B2026.01 | 79.5 | — | — | |
| FMVR-LLaVA#Vision Tokens=28802026.03 | 79.1 | — | — | |
| FMVR-LLaVA#Vision Tokens=7202026.03 | 78.7 | — | — | |
| LVLMModel Scale=7B2026.01 | 78.1 | — | — | |
| FMVR-LLaVA#Vision Tokens=1802026.03 | 76.9 | — | — | |
| PLLaVAModel Scale=7B2026.01 | 76.6 | — | — | |
| PLLaVAModel Scale=13B2026.01 | 75.7 | — | — | |
| MovieChat#Vision Tokens=655362026.03 | 75.2 | — | — | |
| ST-LLM2026.01 | 74.6 | — | — | |
| FMVR-LLaVA#Vision Tokens=452026.03 | 74.2 | — | — | |
| Video-LLaVAtokens_kept=all2026.04 | 72 | — | 3.95 | |
| Video-LLaVABackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 71.6 | — | 3.94 | |
| Video-LLaVA2026.01 | 70.7 | — | — | |
| Video-LLaVA2026.03 | 70.7 | 100 | — | |
| Video-LLAVA#Vision Tokens=20482026.03 | 70.7 | — | — | |
| MI-Prunertokens_kept=2272026.04 | 70.6 | — | 3.94 | |
| VisionZipBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 70.2 | — | 3.94 | |
| DUET-VLM (C)Tokens=960, Token Reduction (%)=53.12%2026.02 | 70.1 | 100.8 | — | |
| LLaMA-VID2026.01 | 70 | — | — | |
| VideoChat22026.01 | 70 | — | — | |
| PyramidDropTokens=960, Token Reduction (%)=53.12%2026.02 | 70 | 100.7 | — | |
| MI-Prunertokens_kept=1142026.04 | 69.9 | — | 3.92 | |
| VanillaBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 69.8 | — | — | |
| Video-LLaVATokens=2048, Token Reduction (%)=0%2026.02 | 69.8 | 100 | — | |
| VanillaBase Model=Video-LLaVA-7B, Token Reduction Rate=0.0%2025.05 | 69.8 | — | — | |
| LLaMA-VID#Vision Tokens=1fps×22026.03 | 69.7 | — | — | |
| VisionTrimBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 69.3 | — | — | |
| VisPruner#Vision Tokens=2272026.03 | 69.3 | — | — | |
| VisPrunertokens_kept=2272026.04 | 69.3 | — | 3.92 | |
| VALLEY2026.01 | 69.2 | — | — | |
| FastVtokens_kept=2272026.04 | 68.9 | — | 3.9 | |
| MoB (with η-prior)Base Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 68.8 | — | — | |
| FMVR-LLaVA#Vision Tokens=52026.03 | 68.7 | — | — | |
| Uniform SamplingBase Model=Video-LLaVA-7B, Number of tokens=1362026.01 | 68.6 | — | — | |
| VisionDropBackbone Model=Video-LLaVA-7B, Token Retention=2562025.06 | 68.4 | — | 3.87 | |
| TwigVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 68.3 | — | — | |
| SparseVLMTokens=136, Token Reduction (%)=93.4%2026.02 | 68.2 | 82.4 | — | |
| SparseVLMBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 68.2 | — | — | |
| SparseVLM2026.03 | 68.2 | 86.5 | — | |
| SparseVLM#Vision Tokens=1982026.03 | 68.2 | — | — | |
| VanillaVisual Tokens=20482026.06 | 68.09 | — | — | |
| DUET-VLM (C)Tokens=136, Token Reduction (%)=93.4%2026.02 | 67.7 | 97.6 | — | |
| BT-Adapter#Vision Tokens=~2602026.03 | 67.5 | — | — | |
| PRUNESID2026.03 | 67.1 | 95.5 | — | |
| GPT4Video2026.01 | 66.3 | — | — | |
| VisPrunertokens_kept=1142026.04 | 65.4 | — | 3.79 | |
| Chat-UniVi2026.01 | 65 | — | — | |
| Video-ChatGPT2026.01 | 64.9 | — | — | |
| Video-ChatGPT#Vision Tokens=~3602026.03 | 64.9 | — | — | |
| FastVtokens_kept=1142026.04 | 64.1 | — | 3.78 | |
| VisionZipTokens=136, Token Reduction (%)=93.4%2026.02 | 63.5 | 91 | — | |
| VisionZipBase Model=Video-LLaVA-7B, Token Reduction Rate=93.4%2025.05 | 63.5 | — | — | |
| VisionZip2026.03 | 63.5 | 93.2 | — | |
| VisionZip#Vision Tokens=1362026.03 | 63.5 | — | — | |
| Upper BoundBackbone=Video-LLaVA-7B2026.04 | 61.93 | — | — | |
| CLASPBackbone=Video-LLaVA-7B2026.04 | 61.62 | — | — | |
| VLAB-G#Data(M)=262023.05 | 61 | — | — | |
| MA-LMM2024.04 | 60.6 | — | — | |
| MA-LMM2026.01 | 60.6 | — | — | |
| MiCo2024.06 | 60.4 | — | — | |
| Method [49]2023.05 | 60.2 | — | — | |
| VAST2023.05 | 60.2 | — | — | |
| SOTA2024.06 | 60.2 | — | — | |
| SCOPEVisual Tokens=1282026.06 | 60.06 | — | — | |
| VALORzero-shot=false2023.12 | 60 | — | — | |
| SparseVLMBackbone=Video-LLaVA-7B2026.04 | 59.29 | — | — | |
| VLAB-L#Data(M)=262023.05 | 59.2 | — | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=Gem2026.06 | 59.2 | — | 3.08 | |
| Video-LLaVAStrategy=Vanilla, Evaluator=GPT2026.06 | 58.9 | — | 3.31 | |
| Video-LLaMA2024.04 | 58.3 | — | — | |
| GiT2#Data(M)=129002023.05 | 58.2 | — | — | |
| SparseVLMStrategy=Merging, Evaluator=Gem2026.06 | 58.2 | — | 3.05 | |
| mPLUG-2#Data(M)=172023.05 | 58.1 | — | — | |
| mPLUG-22024.04 | 58.1 | — | — | |
| Video-LLaVAStrategy=Vanilla, Evaluator=Gem2026.06 | 57.3 | — | 2.93 | |
| Brote-IM-XXLLLM Backbone=FlanT5, #Param LLM=11B2024.02 | 57.29 | — | — | |
| VideoCoCa#Data(M)=1002023.05 | 56.9 | — | — | |
| VideoCoCa2024.04 | 56.9 | — | — | |
| GiT#Data(M)=8002023.05 | 56.8 | — | — | |
| GiT2024.04 | 56.8 | — | — | |
| LAVENDER#Data(M)=302023.05 | 56.6 | — | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=GPT2026.06 | 56.6 | — | 3.26 | |
| OneLLM-7Bzero-shot=true2023.12 | 56.5 | — | — | |
| VideoChat#Vision Tokens=5122026.03 | 56.3 | — | — | |
| Brote-IM-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 56.06 | — | — | |
| SparseVLMStrategy=Merging, Evaluator=GPT2026.06 | 56 | — | 3.2 | |
| SCOPEVisual Tokens=642026.06 | 55.55 | — | — | |
| InternVideo2022.12 | 55.5 | — | — | |
| InternVideo#Data(M)=2102023.05 | 55.5 | — | — | |
| InternVideozero-shot=true2023.12 | 55.5 | — | — | |
| HiTeA#Data(M)=172023.05 | 55.3 | — | — | |
| UMT-L2024.04 | 55.2 | — | — | |
| LLaMA Adapter#Vision Tokens=12802026.03 | 54.9 | — | — | |
| FrozenBiLM#Data(M)=302023.05 | 54.8 | — | — | |
| FrozenBiLM2024.04 | 54.8 | — | — | |
| VIOLETv22024.04 | 54.7 | — | — | |
| VIOLETv22023.10 | 54.7 | — | — | |
| Brote-EX-XXLLLM Backbone=FlanT5, #Param LLM=11B2024.02 | 54.52 | — | — | |
| MMICL-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 53.68 | — | — | |
| Brote-EX-XLLLM Backbone=FlanT5, #Param LLM=3B2024.02 | 53.02 | — | — |