Video Question Answering on MSVD-QA
80.3AccuracyFlash-VStream
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Flash-VStreammode=zero-shot2024.06 | 80.3 | — | 78 | — | |
| PLLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 79.9 | — | 4.2 | — | |
| IG-VLM LLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 79.6 | — | 4.1 | — | |
| IG-VLM LLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 78.8 | — | 4.1 | — | |
| IG-VLM LLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 77.4 | — | 4.1 | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 77.1 | — | — | 4 | |
| IG-VLM CogAgentVision Encoder=CLIP-E, LLM Size=7B2024.04 | 76.7 | — | 4.1 | — | |
| PLLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 76.6 | — | 4.1 | — | |
| PLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 76.6 | — | — | 4.1 | |
| PLLaVAVision Encoder=ViT-L, LLM Size=7B2025.01 | 76.6 | — | — | 4.1 | |
| VLM-RLAIFLLM Size=7B, zero-shot=true2024.02 | 76.4 | — | 4 | — | |
| VLM-RLAIFBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 76.4 | — | — | 4 | |
| IG-VLM GPT-4VVision Encoder=Unk, LLM Size=GPT-42024.04 | 76.3 | — | 4 | — | |
| DeepStack-L-7Bzero-shot=true2024.06 | 76 | — | 4 | — | |
| LLaVA-STModel category=Temporally-Specialized Video LLMs2026.04 | 75.9 | — | — | — | |
| Elysium2024.03 | 75.8 | — | 3.7 | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 75.8 | — | — | 3.9 | |
| PLLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 75.7 | — | 4.1 | — | |
| LLaVA-1.5-7Bzero-shot=true2024.06 | 75.5 | — | 4 | — | |
| MovieChat2024.03 | 75.2 | — | 3.8 | — | |
| MovieChatVision Encoder=CLIP-G, LLM Size=7B2024.04 | 75.2 | — | 3.8 | — | |
| MovieChatmode=zero-shot2024.06 | 75.2 | — | 76 | — | |
| MovieChatBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 75.2 | — | — | 3.8 | |
| MovieChat#Frames=2048, #Vision Tokens per Frame=322025.01 | 75.2 | — | — | 3.8 | |
| MovieChatSize=7B, Evaluation Protocol=Zero-shot2025.12 | 75.2 | — | — | 3.8 | |
| ViLL-EModel category=Temporally-Specialized Video LLMs2026.04 | 75.2 | — | — | — | |
| MovieChatVision Encoder=CLIP-G, LLM Size=7B2025.01 | 75.2 | — | — | 3.8 | |
| Video-LLaVA + PADL+ (16×)LLM size=7B, Compression=16×, adapter fine-tuning=true2026.06 | 75.2 | — | — | 4.1 | |
| CAMDBackbone=VILA2026.03 | 75.1 | — | — | 4.3 | |
| ST-LLMLLM=Vicuna-7B, zero-shot=true2024.03 | 74.6 | — | 3.9 | — | |
| ST-LLMVision Encoder=BLIP2, LLM Size=7B2024.04 | 74.6 | — | 3.9 | — | |
| ST-LLMBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 74.6 | — | — | 3.9 | |
| CAMDBackbone=Video-LLaMA22026.03 | 74.6 | — | — | 4 | |
| ST-LLMModel category=Temporally-Specialized Video LLMs2026.04 | 74.6 | — | — | — | |
| ST-LLMVision Encoder=BLIP2, LLM Size=7B2025.01 | 74.6 | — | — | 3.9 | |
| FarSightBackbone=VILA2026.03 | 74.5 | — | — | 4.2 | |
| LLaVA-OctopusVision Encoder=SIGLIP, LLM Size=7B2025.01 | 74.3 | — | — | 4.1 | |
| FarSightBackbone=Video-LLaMA22026.03 | 73.8 | — | — | 3.9 | |
| LLaVA-Octopus†Vision Encoder=SIGLIP, LLM Size=7B, Training data source=same as Video-LLaVA [36]2025.01 | 73.4 | — | — | 4 | |
| Video-LaVITLLM size=7B, Zero-shot=true2024.02 | 73.2 | — | 3.9 | — | |
| VILA2026.03 | 72.6 | — | — | 4 | |
| VideoScaffoldSize=7B, Frames=60, Evaluation Protocol=Zero-shot2025.12 | 72.5 | — | — | 3.9 | |
| VideoGPT+Protocol=Zero-shot2024.06 | 72.4 | — | 3.9 | — | |
| Video-LLaVA + PADL (16×)LLM size=7B, Compression=16×, adapter fine-tuning=false2026.06 | 72.3 | — | — | 3.9 | |
| Video-LLaVA†Vision Encoder=ViT-L, LLM Size=7B, Training data source=same as Video-LLaVA [36]2025.01 | 71.8 | — | — | 3.9 | |
| MG-LLAVALLM=Vicuna-7B2024.06 | 71.5 | — | — | — | |
| Video-LLaVA + FreePrunerLLM size=7B2026.06 | 71.3 | — | — | 3.9 | |
| DeSAPBackbone=Video-LLaVA-7B, Reduction Rate=50%, Evaluation Protocol=LLaVA [27]2026.04 | 71.2 | — | — | 4 | |
| Video-LLaVA + PruMergeLLM size=7B2026.06 | 71.1 | — | — | 3.9 | |
| FastVBackbone=Video-LLaVA-7B, Reduction Rate=50%, Evaluation Protocol=LLaVA [27]2026.04 | 71 | — | — | 3.9 | |
| HoloVBackbone=Video-LLaVA-7B, Reduction Rate=50%, Evaluation Protocol=LLaVA [27]2026.04 | 71 | — | — | 4 | |
| LLaVA-Mini#Frames=1fps, #Vision Tokens per Frame=12025.01 | 70.9 | — | — | 4 | |
| Video-LLaMA22026.03 | 70.9 | — | — | 3.8 | |
| VideoLLaMA2Vision Encoder=ViT-L, LLM Size=7B2025.01 | 70.9 | — | — | 3.8 | |
| LLaVA-SFT + VideoScaffoldSize=7B, Frames=60, Evaluation Protocol=Zero-shot2025.12 | 70.8 | — | — | 3.6 | |
| Video-LLaVAVision Encoder=ViT-L, LLM Size=7B2024.04 | 70.7 | — | 3.9 | — | |
| Video-LLaVALLM size=7B, Zero-shot=true2024.02 | 70.7 | — | 3.9 | — | |
| Video-LLaVAProtocol=Zero-shot2024.06 | 70.7 | — | 3.9 | — | |
| Video-LLaVALLM=Vicuna-7B2024.06 | 70.7 | — | — | — | |
| Video-LLaVALLM Size=7B, zero-shot=true2024.02 | 70.7 | — | 3.9 | — | |
| Video-LLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 70.7 | — | — | 3.9 | |
| Video-LLaVA#Frames=8, #Vision Tokens per Frame=2562025.01 | 70.7 | — | — | 3.9 | |
| Video-LLaVALLM size=7B2026.06 | 70.7 | — | — | 3.9 | |
| Upper Bound2025.12 | 70.5 | — | — | 3.93 | |
| Video-LLaVALLM Backbone=Vicuna-7B, Data Scale=700K, Zero-shot=true2026.01 | 70.4 | — | — | 3.9 | |
| FlashVLMKeep Tokens=455, Prune Percentage=77.8%2025.12 | 70.3 | — | — | 3.97 | |
| VisPrunerKeep Tokens=455, Prune Percentage=77.8%2025.12 | 70.2 | — | — | 3.95 | |
| Video-LLaVA-7BBackbone=Video-LLaVA-7B, Reduction Rate=None, Evaluation Protocol=LLaVA [27]2026.04 | 70.2 | — | — | 3.9 | |
| LLAMA-VIDLLM=Vicuna-13B, zero-shot=true2024.03 | 70 | — | 3.7 | — | |
| VideoChat2LLM=Vicuna-7B, zero-shot=true2024.03 | 70 | — | 3.9 | — | |
| VideoChat2Vision Encoder=UMT-L, LLM Size=7B2024.04 | 70 | — | 3.9 | — | |
| LLAMA-VIDVision Encoder=CLIP-G, LLM Size=13B2024.04 | 70 | — | 3.7 | — | |
| LLaMA-VIDProtocol=Zero-shot2024.06 | 70 | — | 3.7 | — | |
| VideoChat2Protocol=Zero-shot2024.06 | 70 | — | 3.9 | — | |
| VideoChat2LLM Size=7B, zero-shot=true2024.02 | 70 | — | 3.9 | — | |
| LLaMA-VIDLLM Size=13B, zero-shot=true2024.02 | 70 | — | 3.7 | — | |
| VideoChat2Base LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 70 | — | — | 3.9 | |
| VideoChat2LLM Backbone=Vicuna-7B, Data Scale=2M, Zero-shot=true2026.01 | 70 | — | — | 3.9 | |
| LLaMA-VIDSize=13B, Evaluation Protocol=Zero-shot2025.12 | 70 | — | — | 3.7 | |
| VideoChat2-HDVision Encoder=UMT-L, LLM Size=7B2025.01 | 70 | — | — | 3.9 | |
| VanillaBase Model=Video-LLaVA-7B2026.01 | 69.8 | — | — | 3.92 | |
| LLAMA-VIDLLM=Vicuna-7B, zero-shot=true2024.03 | 69.7 | — | 3.7 | — | |
| LLaMA-VIDLLM size=7B, Zero-shot=true2024.02 | 69.7 | — | 3.7 | — | |
| LLaMA-VIDLLM Size=7B, zero-shot=true2024.02 | 69.7 | — | 3.7 | — | |
| LLaMA-VIDmode=zero-shot2024.06 | 69.7 | — | 74 | — | |
| LLaMA-VIDBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 69.7 | — | — | 3.7 | |
| LLaMA-VID#Frames=1fps, #Vision Tokens per Frame=22025.01 | 69.7 | — | — | 3.7 | |
| LLaMA-VID†Vision Encoder=CLIP-G, LLM Size=7B, Training data source=same as Video-LLaVA [36]2025.01 | 69.7 | — | — | 3.7 | |
| FlashVLMKeep Tokens=227, Prune Percentage=88.9%2025.12 | 69.6 | — | — | 3.94 | |
| LLaVA-SFT + VideoScaffoldSize=7B, Frames=16, Evaluation Protocol=Zero-shot2025.12 | 69.5 | — | — | 3.6 | |
| VisPrunerKeep Tokens=227, Prune Percentage=88.9%2025.12 | 69.3 | — | — | 3.92 | |
| FastVKeep Tokens=455, Prune Percentage=77.8%2025.12 | 69.1 | — | — | 3.91 | |
| FastVKeep Tokens=227, Prune Percentage=88.9%2025.12 | 68.9 | — | — | 3.9 | |
| MomentorModel category=Temporally-Specialized Video LLMs2026.04 | 68.9 | — | — | — | |
| VisionTrimBase Model=Video-LLaVA-7B2026.01 | 68.6 | — | — | 3.93 | |
| VideoLLaMA2†Vision Encoder=ViT-L, LLM Size=7B, Training data source=same as Video-LLaVA [36]2025.01 | 68.4 | — | — | 3.8 | |
| LLaVA-SFTSize=7B, Frames=16, Evaluation Protocol=Zero-shot2025.12 | 68.3 | — | — | 3.4 | |
| SparseVLMBase Model=Video-LLaVA-7B2026.01 | 68.2 | — | — | 3.9 | |
| GroundingGPTLLM Size=7B2024.01 | 67.8 | — | — | 3.7 | |
| BT-AdapterVision Encoder=CLIP-G, LLM Size=7B2025.01 | 67.7 | — | — | 3.7 |