Video Question Answering on MVBench (Accuracy)
77.1AccuracyPLM
Evaluation Results
| Method | Links | |
|---|---|---|
| PLMModel Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 77.1 | |
| InternVL3-8BNumber of sampled frames=322026.03 | 73.2 | |
| HINT InternVL3-8BNumber of sampled frames=32, Backbone=InternVL3-8B2026.03 | 73.2 | |
| InternVL-3.5Model Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 72.1 | |
| Gemini 2.5 Pro2026.01 | 69.9 | |
| VideoLLaMA3-7BFrames=1802026.01 | 69.7 | |
| Q2.5VL-7BTokens Retained Percentage=100%2025.03 | 69.6 | |
| TwigVLM++Tokens Retained Percentage=33.3%2025.03 | 69.1 | |
| KPMMoPE=false, Size=7B2026.02 | 69.03 | |
| KPMMoPE=true, Size=7B2026.02 | 69.01 | |
| Qwen3-VLModel Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 69 | |
| QWen2.5-VL-7BSize=7B2026.02 | 68.94 | |
| Qwen2-VL-7B-InstructFrames=2fps2026.01 | 68.7 | |
| TwigVLM++Tokens Retained Percentage=22.2%2025.03 | 68.6 | |
| VisionZipTokens Retained Percentage=33.3%2025.03 | 68.1 | |
| TwigVLMTokens Retained Percentage=33.3%2025.03 | 68 | |
| VanillaRet.=100%2026.05 | 67.8 | |
| Qwen-2.5VLModel category=General Video LLMs2026.04 | 67 | |
| VisionZipTokens Retained Percentage=22.2%2025.03 | 66.8 | |
| OTT-VidRet.=25%2026.05 | 66.5 | |
| TwigVLMTokens Retained Percentage=22.2%2025.03 | 66.4 | |
| OTT-VidRet.=20%2026.05 | 66.3 | |
| FastVTokens Retained Percentage=33.3%2025.03 | 66.2 | |
| LLaVA-OV-2Model Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 66.2 | |
| HoliTomRet.=25%2026.05 | 66.1 | |
| HoliTomRet.=20%2026.05 | 66.1 | |
| TARZero-shot=true2025.08 | 66.1 | |
| FlashVIDRet.=25%2026.05 | 66 | |
| FlashVIDRet.=20%2026.05 | 65.8 | |
| VisionZipTokens Retained Percentage=11.1%2025.03 | 65.6 | |
| Time-R1Zero-shot=true2025.08 | 65.6 | |
| TwigVLM++Tokens Retained Percentage=11.1%2025.03 | 65.5 | |
| OTT-VidRet.=15%2026.05 | 65.5 | |
| UniCompRet.=25%2026.05 | 65.4 | |
| HoliTomRet.=15%2026.05 | 65.4 | |
| Qwen2.5-VL-7BZero-shot=true, Parameters=7B2025.08 | 65.2 | |
| FastVIDRet.=25%2026.05 | 65.1 | |
| FastVIDRet.=20%2026.05 | 65.1 | |
| FlashVIDRet.=15%2026.05 | 65.1 | |
| UniCompRet.=20%2026.05 | 64.8 | |
| ViLL-EModel category=Temporally-Specialized Video LLMs2026.04 | 64.7 | |
| LLaVA-STModel category=Temporally-Specialized Video LLMs2026.04 | 64.2 | |
| FastVIDRet.=15%2026.05 | 64.2 | |
| HoliTomRet.=10%2026.05 | 64.2 | |
| UniCompRet.=15%2026.05 | 64.1 | |
| OTT-VidRet.=10%2026.05 | 64 | |
| Video-R1-7BFrames=322026.01 | 63.9 | |
| LLaVA-Video-7B+TIR-FlowFrames=322026.01 | 63.9 | |
| FlashVIDRet.=10%2026.05 | 63.7 | |
| Qwen2.5-VL-7B+TIR-FlowFrames=322026.01 | 63.6 | |
| FastVIDRet.=10%2026.05 | 63.2 | |
| UniCompRet.=10%2026.05 | 61.9 | |
| FastVTokens Retained Percentage=22.2%2025.03 | 61.3 | |
| TwigVLMTokens Retained Percentage=11.1%2025.03 | 61 | |
| FastVTokens Retained Percentage=11.1%2025.03 | 59.3 | |
| Qwen2.5-VL-7BFrames=322026.01 | 59 | |
| LLaVA-Video-7BFrames=322026.01 | 58.6 | |
| LLaVA-VideoModel category=General Video LLMs2026.04 | 58.6 | |
| Keye-VL-1.5Model Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 56.9 | |
| ST-LLMModel category=Temporally-Specialized Video LLMs2026.04 | 54.9 | |
| MaD-MixModel size=7B, Evaluation protocol=0-shot2026.02 | 53.6 | |
| FusedModel size=7B, Evaluation protocol=0-shot2026.02 | 53.12 | |
| UniformModel size=7B, Evaluation protocol=0-shot2026.02 | 52.73 | |
| AvgModel size=7B, Evaluation protocol=0-shot2026.02 | 51.58 | |
| LLaVA-OV-1.5Model Class=8B, Evaluation Framework=LMMs-Eval2026.05 | 51.2 | |
| LLaVA-Mini-8BFrames=1fps2026.01 | 44.5 | |
| MaD-MixModel size=0.5B, Evaluation protocol=0-shot2026.02 | 40.7 | |
| TimeChatModel category=Temporally-Specialized Video LLMs2026.04 | 38.5 | |
| FusedModel size=0.5B, Evaluation protocol=0-shot2026.02 | 37.02 | |
| UniformModel size=0.5B, Evaluation protocol=0-shot2026.02 | 36.67 | |
| AvgModel size=0.5B, Evaluation protocol=0-shot2026.02 | 36.5 | |
| LLaVA-onevision-7BFrames=322026.01 | 33.9 |