Video Question Answering on MSRVTT-QA
72.4AccuracyFlash-VStream
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Flash-VStreammode=zero-shot2024.06 | 72.4 | 3.4 | — | |
| PLLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 68.7 | 3.8 | — | |
| PLLaVALLM Size=34B, Vision Encoder=CLIP-L2024.07 | 68.7 | 3.8 | — | |
| PLLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 68.7 | 3.8 | — | |
| Elysium2024.03 | 67.5 | 3.2 | — | |
| Elysium2025.01 | 67.5 | 3.2 | — | |
| SF-LLaVA-34BLLM Size=34B, Vision Encoder=CLIP-L2024.07 | 67.4 | 3.7 | — | |
| SF-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 67.4 | 3.7 | — | |
| TS-LLAVALLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 66.2 | 3.6 | — | |
| SF-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 65.8 | 3.6 | — | |
| ViLL-EModel category=Temporally-Specialized Video LLMs2026.04 | 65.2 | — | — | |
| TS-LLaVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 65.1 | 3.6 | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 64.3 | 3.5 | — | |
| Video-LLaVA + PADL+ (16×)LLM size=7B, Compression=16×, adapter fine-tuning=true2026.06 | 64.1 | 3.7 | — | |
| IG-VLM GPT-4VVision Encoder=Unk, LLM Size=GPT-42024.04 | 63.8 | 3.5 | — | |
| IG-VLM LLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 63.7 | 3.5 | — | |
| IG-VLMLLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 63.7 | 3.5 | — | |
| ST-LLMLLM=Vicuna-7B, zero-shot=true2024.03 | 63.2 | 3.4 | — | |
| ST-LLMVision Encoder=BLIP2, LLM Size=7B2024.04 | 63.2 | 3.4 | — | |
| PLLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 63.2 | 3.6 | — | |
| ST-LLMBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 63.2 | 3.4 | — | |
| ST-LLM2025.01 | 63.2 | 3.4 | — | |
| ST-LLMModel category=Temporally-Specialized Video LLMs2026.04 | 63.2 | — | — | |
| VLM-RLAIFLLM Size=7B, zero-shot=true2024.02 | 63 | 3.4 | — | |
| VLM-RLAIFBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=true2024.11 | 63 | 3.4 | — | |
| IG-VLM CogAgentVision Encoder=CLIP-E, LLM Size=7B2024.04 | 62.7 | 3.6 | — | |
| IG-VLM LLaVA 13BVision Encoder=ViT-L, LLM Size=13B2024.04 | 62.6 | 3.4 | — | |
| IG-VLM LLaVA 34BVision Encoder=ViT-L, LLM Size=34B2024.04 | 62.4 | 3.5 | — | |
| IG-VLM (LLaVA-v1.6)LLM Size=34B, Vision Encoder=CLIP-L2024.07 | 62.4 | 3.5 | — | |
| IG-VLMLLM Size=34B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 62.4 | 3.5 | — | |
| CATLLM Size=7B, Zero-shot=true2024.03 | 62.1 | 3.5 | — | |
| CATBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 62.1 | 3.5 | — | |
| PLLaVA 7BVision Encoder=ViT-L, LLM Size=7B2024.04 | 62 | 3.5 | — | |
| PLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 62 | 3.5 | — | |
| PLLAVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 62 | 3.5 | — | |
| P-LLaVAParameters=7B2025.01 | 62 | 3.5 | — | |
| PPLLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 61.9 | 3.3 | — | |
| Video-LLaVA + PADL (16×)LLM size=7B, Compression=16×, adapter fine-tuning=false2026.06 | 61.1 | 3.5 | — | |
| VideoGPT+Protocol=Zero-shot2024.06 | 60.6 | 3.6 | — | |
| VideoGPT+LLM Size=3.8B, Vision Encoder=CLIP-L, Training-free=false2024.11 | 60.6 | 3.6 | — | |
| VISTA-LLAMALLM Size=7B, Zero-shot=true2024.03 | 60.5 | 3.3 | — | |
| Vista-LLaMAVision Encoder=CLIP-G, LLM Size=7B2024.04 | 60.5 | 3.3 | — | |
| Vista-LLaMAmode=zero-shot2024.06 | 60.5 | 3.3 | — | |
| Vista-LLaMABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 60.5 | 3.3 | — | |
| Vista-LLaMALLM Size=7B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 60.5 | 3.3 | — | |
| VISTA-LLaMALLM Backbone=LLaMA-7B, Data Scale=100K, Zero-shot=true2026.01 | 60.5 | 3.3 | — | |
| VISTA-LLAMAZero-shot=true2023.12 | 60.5 | 3.3 | — | |
| Grounded-VideoLLM2025.01 | 60.3 | 3.6 | — | |
| FreeVALLM Size=7B, Vision Encoder=CLIP-L, Training-free=true2024.11 | 60 | 3.5 | — | |
| MG-LLAVALLM=Vicuna-7B2024.06 | 59.8 | — | — | |
| LongVLM2025.01 | 59.8 | 3.3 | — | |
| LLaVA-Mini#Frames=1fps, #Vision Tokens per Frame=12025.01 | 59.5 | 3.6 | — | |
| Video-LLaVA + FreePrunerLLM size=7B2026.06 | 59.5 | 3.5 | — | |
| Video-LaVITLLM size=7B, Zero-shot=true2024.02 | 59.3 | 3.3 | — | |
| Video-LLaVAVision Encoder=ViT-L, LLM Size=7B2024.04 | 59.2 | 3.5 | — | |
| Video-LLaVALLM size=7B, Zero-shot=true2024.02 | 59.2 | 3.5 | — | |
| Video-LLaVAProtocol=Zero-shot2024.06 | 59.2 | 3.5 | — | |
| Video-LLaVALLM=Vicuna-7B2024.06 | 59.2 | — | — | |
| Video-LLaVALLM Size=7B, zero-shot=true2024.02 | 59.2 | 3.5 | — | |
| Video-LLaVABase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 59.2 | 3.5 | — | |
| Video-LLaVALLM Size=7B, Vision Encoder=ViT-L, Training-free=false2024.11 | 59.2 | 3.5 | — | |
| Video-LLaVA#Frames=8, #Vision Tokens per Frame=2562025.01 | 59.2 | 3.5 | — | |
| Video-LLaVALLM size=7B2026.06 | 59.2 | 3.5 | — | |
| LLaVA-ST2025.01 | 59 | 3.5 | — | |
| LLaVA-STModel category=Temporally-Specialized Video LLMs2026.04 | 59 | — | — | |
| LLAMA-VIDLLM Size=13B, Zero-shot=true2024.03 | 58.9 | 3.3 | — | |
| LLAMA-VIDLLM=Vicuna-13B, zero-shot=true2024.03 | 58.9 | 3.3 | — | |
| LLAMA-VIDVision Encoder=CLIP-G, LLM Size=13B2024.04 | 58.9 | 3.3 | — | |
| LLaMA-VIDProtocol=Zero-shot2024.06 | 58.9 | 3.3 | — | |
| LLaMA-VIDLLM Size=13B, zero-shot=true2024.02 | 58.9 | 3.2 | — | |
| LLaMA-VIDSize=13B, Evaluation Protocol=Zero-shot2025.12 | 58.9 | 3.3 | — | |
| VideoScaffoldSize=7B, Frames=60, Evaluation Protocol=Zero-shot2025.12 | 58.4 | 3.3 | — | |
| Video-LLaVA + PruMergeLLM size=7B2026.06 | 58.4 | 3.5 | — | |
| Video-LLaVALLM Backbone=Vicuna-7B, Data Scale=700K, Zero-shot=true2026.01 | 58.3 | 3.5 | — | |
| V-CORELLM Backbone=Vicuna-7B, Data Scale=100K, Zero-shot=true2026.01 | 57.8 | 3.3 | — | |
| LLAMA-VIDLLM Size=7B, Zero-shot=true2024.03 | 57.7 | 3.2 | — | |
| LLAMA-VIDLLM=Vicuna-7B, zero-shot=true2024.03 | 57.7 | 3.2 | — | |
| LLaMA-VIDLLM size=7B, Zero-shot=true2024.02 | 57.7 | 3.2 | — | |
| LLaMA-VIDLLM Size=7B, zero-shot=true2024.02 | 57.7 | 3.2 | — | |
| LLaMA-VIDmode=zero-shot2024.06 | 57.7 | 3.2 | — | |
| LLaMA-VIDBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 57.7 | 3.2 | — | |
| LLaMA-VIDLLM Size=13B, Vision Encoder=CLIP-G, Training-free=false2024.11 | 57.7 | 3.2 | — | |
| LLaMA-VID#Frames=1fps, #Vision Tokens per Frame=22025.01 | 57.7 | 3.2 | — | |
| Upper Bound2025.12 | 57.5 | 3.5 | — | |
| Video-LLaVA-7BBackbone=Video-LLaVA-7B, Reduction Rate=None, Evaluation Protocol=LLaVA [27]2026.04 | 57.3 | 3.5 | — | |
| BT-AdapterLLM=Vicuna-7B, zero-shot=true2024.03 | 57 | 3.2 | — | |
| BT-AdapterLLM Size=7B, zero-shot=true2024.02 | 57 | 3.2 | — | |
| BT-AdapterBase LLM=Vicuna-7B, Alignment Tuning (DPO/PPO)=false2024.11 | 57 | 3.2 | — | |
| BT-Adapter#Frames=100, #Vision Tokens per Frame=~2.62025.01 | 57 | 3.2 | — | |
| FlashVLMKeep Tokens=455, Prune Percentage=77.8%2025.12 | 57 | 3.51 | — | |
| DeSAPBackbone=Video-LLaVA-7B, Reduction Rate=50%, Evaluation Protocol=LLaVA [27]2026.04 | 57 | 3.6 | — | |
| VanillaBase Model=Video-LLaVA-7B2026.01 | 56.7 | 3.48 | — | |
| VisPrunerKeep Tokens=455, Prune Percentage=77.8%2025.12 | 56.7 | 3.5 | — | |
| HoloVBackbone=Video-LLaVA-7B, Reduction Rate=50%, Evaluation Protocol=LLaVA [27]2026.04 | 56.5 | 3.6 | — | |
| LLaVA-SFT + VideoScaffoldSize=7B, Frames=60, Evaluation Protocol=Zero-shot2025.12 | 56.3 | 3.2 | — | |
| FlashVLMKeep Tokens=227, Prune Percentage=88.9%2025.12 | 55.8 | 3.47 | — | |
| LLaVA-SFT + VideoScaffoldSize=7B, Frames=16, Evaluation Protocol=Zero-shot2025.12 | 55.7 | 3.2 | — | |
| Momentor2025.01 | 55.6 | 3 | — | |
| VisPrunerKeep Tokens=227, Prune Percentage=88.9%2025.12 | 55.6 | 3.45 | — | |
| MomentorModel category=Temporally-Specialized Video LLMs2026.04 | 55.6 | — | — |