Video Question Answering on NextQA
85.4AccuracyPenguin-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Penguin-VLModel Size=8B2026.03 | 85.4 | |
| A4VL2026.03 | 85.1 | |
| VideoLLaMA3-7B2025.05 | 84.5 | |
| InternVL2.5-8Bresults reproduced=true2026.03 | 84.1 | |
| InternVL3-78BModel Size=78B2026.03 | 84 | |
| LLaVA-Video-72B-Qwen2Model Size=72B, Backbone=Qwen22026.03 | 83.7 | |
| LVAgent2026.03 | 83 | |
| InternVL-3 + A.I.R.VLM Size=8B, #Frames=≤ 322025.10 | 82.6 | |
| A.I.R. (w_worst = 72)#Analyzed=32.2, Training-free=True, Backbone=InternVL3-8B, w_worst=722025.10 | 82.6 | |
| A.I.R.Venue=-, Base Model=InternVL3-8B, #Frames=≤322025.10 | 82.6 | |
| A.I.R.Venue=-, Base Model=GPT-4o, #Frames=≤322025.10 | 82.5 | |
| Qwen3-VLModel Size=8B2026.03 | 82.3 | |
| InternVL-3VLM Size=8B, #Frames=322025.10 | 82.3 | |
| InternVL-3 + MDP3VLM Size=8B, #Frames=322025.10 | 82.3 | |
| InternVL3-8Bresults reproduced=true2026.03 | 82 | |
| Dynin-Omninative speech input/output capability=true2026.03 | 81.9 | |
| A.I.R. (w_worst = 16)#Analyzed=12.4, Training-free=True, Backbone=InternVL3-8B, w_worst=162025.10 | 81.7 | |
| LLaVA-OneVision + A.I.R.VLM Size=7B, #Frames=≤ 322025.10 | 81.6 | |
| A.I.R.Venue=-, Base Model=LLaVA-OV-7B, #Frames=≤322025.10 | 81.6 | |
| InternVL-3.5Model Size=8B2026.03 | 81.3 | |
| QwenVL-2.5 + A.I.R.VLM Size=7B, #Frames=≤ 322025.10 | 81.3 | |
| LLaVA-Video-7B-Qwen2Model Size=7B, Backbone=Qwen22026.03 | 81.2 | |
| VideoLLaMA3-2B2025.05 | 81.2 | |
| VideoSafety-R1backbone=VideoLLaMA3-2B2025.05 | 80.9 | |
| VideoAgent2Venue=arXiv’25, Base Model=GPT-4o, #Frames=-2025.10 | 80.5 | |
| T*VLM Size=7B, #Frames=82025.10 | 80.4 | |
| T*Venue=CVPR’25, Base Model=LLaVA-OV-7B, #Frames=82025.10 | 80.4 | |
| LLaVA-OneVision-72BModel Size=72B, Source=Paper/Leaderboard2026.03 | 80.2 | |
| A.I.R.Venue=-, Base Model=Qwen2VL-7B, #Frames=≤322025.10 | 80.1 | |
| Penguin-VLParameters=2B2026.03 | 79.9 | |
| QwenVL-2.5-72BModel Size=72B2026.03 | 79.6 | |
| BOLTSource=Paper/Leaderboard2026.03 | 79.5 | |
| LLaVA-OneVision + BOLTVLM Size=7B, #Frames=322025.10 | 79.5 | |
| LLaVA-OV2026.03 | 79.4 | |
| LLaVA-OneVisionVLM Size=7B, #Frames=322025.10 | 79.3 | |
| Show-o2video generation support=true2026.03 | 79 | |
| InternVL3.5-38BModel Size=38B2026.03 | 78.9 | |
| LLaVA-OneVision + MDP3VLM Size=7B, #Frames=322025.10 | 78.9 | |
| GPT-5.2Encoding=Uniform-8, Variant=Plain2026.06 | 78.9 | |
| Hu et al. (2025)VLM Size=8.5B, #Frames=322025.10 | 78.4 | |
| Hu et al. (2025)#Analyzed=128, Training-free=False, Backbone=InternVL3-8B2025.10 | 78.4 | |
| AKEYSVenue=arXiv’25, Base Model=GPT-4o, #Frames=≤322025.10 | 78.1 | |
| Gemini 3 FlashEncoding=Uniform-8, Variant=Plain2026.06 | 77.7 | |
| Qwen3-VLParameters=2B2026.03 | 76.9 | |
| QwenVL-2.5-7BModel Size=7B2026.03 | 76.8 | |
| QwenVL-2.5-32BModel Size=32B2026.03 | 76.8 | |
| Qwen2.5-Omni-7Bresults reproduced=true2026.03 | 76.4 | |
| InternVL3.5-8BModel Size=8B2026.03 | 76.2 | |
| InternVL3.5Parameters=2B2026.03 | 76.1 | |
| FullEvo (Cat.)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 75.7 | |
| VideoTreeVLM Size=GPT42025.10 | 75.6 | |
| VideoTree#Analyzed=128, Training-free=True, Backbone=InternVL3-8B2025.10 | 75.6 | |
| Gemini 3 FlashEncoding=Cascade, Variant=+SkillMemCat2026.06 | 75.5 | |
| Gemini 3 FlashEncoding=Cascade, Variant=Seed2026.06 | 75.1 | |
| FullEvo (Guide)Backbone=Gemini 3 Flash, Encoding=Cascade2026.06 | 74.5 | |
| QwenVL-2.5 + MDP3VLM Size=7B, #Frames=322025.10 | 74.4 | |
| QwenVL-2.5VLM Size=7B, #Frames=322025.10 | 74.3 | |
| Gemini 3 FlashEncoding=Cascade, Variant=+Evolve2026.06 | 73.9 | |
| SeViLAVLM Size=4.1B, #Frames=42025.10 | 73.8 | |
| SeViLA#Analyzed=32, Training-free=True, Backbone=InternVL3-8B2025.10 | 73.8 | |
| FullEvo (Guide)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 73.3 | |
| GPT-5.2Encoding=Cascade, Variant=Plain2026.06 | 73.2 | |
| DYTO-34BModel Size=34B, Source=Paper/Leaderboard2026.03 | 72.9 | |
| Gemini 3 FlashEncoding=Cascade, Variant=Plain2026.06 | 72.7 | |
| FullEvo (Cat.)Backbone=GPT-5.2, Encoding=Cascade2026.06 | 72.5 | |
| GPT-5.2Encoding=Cascade, Variant=+Evolve2026.06 | 72.3 | |
| GPT-5.2Encoding=Cascade, Variant=Seed2026.06 | 72 | |
| VideoAgentVLM Size=GPT4, #Frames=1FPS2025.10 | 71.3 | |
| VideoAgent#Analyzed=48, Training-free=True, Backbone=InternVL3-8B2025.10 | 71.3 | |
| GPT-5.2Encoding=Cascade, Variant=+SkillMemCat2026.06 | 70.9 | |
| VILA-1.5 + A.I.R.VLM Size=8B, #Frames=82025.10 | 70.3 | |
| LLaVA-NeXT-Video-34BModel Size=34B2026.03 | 70.1 | |
| LongVA-7BModel Size=7B, Source=Paper/Leaderboard2026.03 | 69.3 | |
| MoReVQASource=Paper/Leaderboard2026.03 | 69.2 | |
| VideoLlama3-7BModel Size=7B2026.03 | 67.4 | |
| VILA-1.5 + Frame-VoyagerVLM Size=8B, #Frames=82025.10 | 67.3 | |
| Frame-Voyager#Analyzed=128, Training-free=False, Backbone=InternVL3-8B2025.10 | 67.3 | |
| LLoViVLM Size=GPT3.5, #Frames=0.5FPS2025.10 | 66.3 | |
| VideoAgent2026.03 | 66.1 | |
| VILA-1.5 + MDP3VLM Size=8B, #Frames=82025.10 | 66.1 | |
| TraveLER2026.03 | 66 | |
| VILA-1.5VLM Size=8B, #Frames=82025.10 | 65.9 | |
| Gemma3n E2B-itParameters=E2B-it, Inference template=Penguin's template, Frame budget=322026.03 | 65.4 | |
| SeViLA2026.03 | 64 | |
| SmolVLM2Parameters=2.2B2026.03 | 62.4 | |
| VideoChat2-7BModel Size=7B, Source=Paper/Leaderboard2026.03 | 61.7 | |
| OpenAI GPT-5 nanoModel Size=nano2026.03 | 59.3 | |
| ViperGPT2026.03 | 56.9 | |
| IXC-2.52026.03 | 55.8 | |
| MVUVLM Size=13B, #Frames=162025.10 | 55.2 | |
| MVU#Analyzed=16, Training-free=True, Backbone=InternVL3-8B2025.10 | 55.2 | |
| LLaVA-NeXT-Video-7BModel Size=7B2026.03 | 39.7 |