Video Understanding on MLVU (Accuracy)
81.5AccuracyRETOOL-VIDEO
Evaluation Results
| Method | Links | |
|---|---|---|
| RETOOL-VIDEOSize=9B2026.05 | 81.5 | |
| Gemini-2.5-Flash-Lite2026.05 | 78.5 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 76.4 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 75 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 74.7 | |
| Gemini 1.5 ProSetting=best-setting numbers from official reports2026.05 | 74.3 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 74.2 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 74.2 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 73.2 | |
| AdaQEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 73.1 | |
| Video-LLaMA3-7BEvaluation Protocol=vanilla offline2026.05 | 73 | |
| InternVL3.5-30B-A3BSize=30B2026.05 | 73 | |
| Claude-Sonnet-4.52026.05 | 72.8 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 72.8 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 72.6 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 72.4 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 71.8 | |
| AdaQEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 71.8 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 71.5 | |
| LLaVA-Video-7BBase Model=LLaVA-Video-7B, Input Frames=642026.04 | 71.4 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 71.2 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 71.2 | |
| Qwen3-VL-8BFrames=64, MLLM Backbone=Qwen3-VL-8B2026.06 | 71 | |
| LLaVA-Video-7BEvaluation Protocol=vanilla offline2026.05 | 70.8 | |
| InternVL3-8B + LiteFrameFrames=256 (8×)2026.05 | 70.7 | |
| Top-kEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 70.7 | |
| Tango†Base Model=LLaVA-Video-7B, Retention Ratio=20%, Intra-LLM=true, Input Frames=642026.04 | 70.4 | |
| LLaVA-Video 7BRetention Ratio R=100%, # Newline Tokens M=8322026.05 | 70.3 | |
| BOLTEmbedding Model=CLIP, Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 70.3 | |
| E-VRAGEmbedding Model=VLM (2B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 70.2 | |
| NVILASize=8B2026.05 | 70.1 | |
| InternVL3-8BFrames=322026.05 | 69.6 | |
| AKSEmbedding Model=BLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 69.6 | |
| LLaVA-Video-7BFrames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 69.5 | |
| AdaQEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 69.4 | |
| InternVL3-8B + FastVIDFrames=128 (4×)2026.05 | 69.3 | |
| GPT-5-Nano-2025-08-072026.05 | 69.2 | |
| FRAGEmbedding Model=MLLM (7B), Frames=64, MLLM Backbone=LLaVA-Video-7B2026.06 | 69.2 | |
| InternVL-V2.5-8BEvaluation Protocol=vanilla offline2026.05 | 68.9 | |
| TangoBase Model=LLaVA-Video-7B, Retention Ratio=20%, Input Frames=642026.04 | 68.7 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 68.6 | |
| Q-FrameEmbedding Model=LongCLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 68.5 | |
| AdaQEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 68.5 | |
| HoliTomBase Model=LLaVA-Video-7B, Retention Ratio=20%, Input Frames=642026.04 | 68.2 | |
| FastVIDBase Model=LLaVA-Video-7B, Retention Ratio=20%, Input Frames=642026.04 | 68.1 | |
| VisionZipBase Model=LLaVA-Video-7B, Retention Ratio=20%, Input Frames=642026.04 | 67.7 | |
| Tango†Base Model=LLaVA-Video-7B, Retention Ratio=10%, Intra-LLM=true, Input Frames=642026.04 | 67.6 | |
| OneClip-RAGEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 67.6 | |
| StreamAgent-7B#Frames=1fps2025.08 | 67.2 | |
| Qwen2.5-VL-7B#Frames=1fps2025.08 | 66.9 | |
| Top-kEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 66.9 | |
| AKSEmbedding Model=BLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 66.8 | |
| BOLTEmbedding Model=CLIP, Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 66.8 | |
| TangoBase Model=LLaVA-Video-7B, Retention Ratio=10%, Input Frames=642026.04 | 66.7 | |
| InternVL3-8B + LiteFrameFrames=128 (8×)2026.05 | 66.7 | |
| InternVL3-8BFrames=162026.05 | 66.4 | |
| Flash-VStreamSize=7B2026.05 | 66.3 | |
| HoliTomBase Model=LLaVA-Video-7B, Retention Ratio=10%, Input Frames=642026.04 | 66.2 | |
| InternVL-V3.5-8BEvaluation Protocol=vanilla offline2026.05 | 66.2 | |
| EvoStreaming-8B-InternVL-V3.5Evaluation Protocol=vanilla offline2026.05 | 66 | |
| InternVL3-8B + LiteFrameFrames=64 (8×)2026.05 | 65.7 | |
| DyCokeRetention Ratio R=32.1%, # Newline Tokens M=2562026.05 | 65.7 | |
| Qwen2.5-VL-7BFrames=64, MLLM Backbone=Qwen2.5-VL-7B2026.06 | 65.5 | |
| TimeChat-Online-7B#Frames=1fps2025.08 | 65.4 | |
| LongVU-7BEvaluation Protocol=vanilla offline2026.05 | 65.4 | |
| FRAGEmbedding Model=MLLM (7B), Frames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 65.3 | |
| LLaVA-OV 7BRetention Ratio R=100%2026.05 | 65.2 | |
| Video-Thinker-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 65.2 | |
| FastVIDBase Model=LLaVA-Video-7B, Retention Ratio=10%, Input Frames=642026.04 | 65.1 | |
| InternVL3-8B + FastVIDFrames=64 (4×)2026.05 | 65.1 | |
| ParaVT-8BSetting=tool-augmented setting (<think>→<tool_call>→<answer>)2026.05 | 65 | |
| LLaVA-OneVision-7BEvaluation Protocol=vanilla offline2026.05 | 64.7 | |
| GPT-4oEvaluation Protocol=vanilla offline2026.05 | 64.6 | |
| GPT-4o2026.05 | 64.6 | |
| DynaTokRetention Ratio R=24.9%, # Newline Tokens M=8322026.05 | 64.6 | |
| GPT-4oSetting=best-setting numbers from official reports2026.05 | 64.6 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B, Input Frames=322026.04 | 64.4 | |
| VideoMindSize=7B2026.05 | 64.4 | |
| InternVL-V2-8BEvaluation Protocol=vanilla offline2026.05 | 64 | |
| InternVL3-8B + FastVIDFrames=32 (4×)2026.05 | 64 | |
| FastVRetention Ratio R=100%/25%, # Newline Tokens M=832/568.72026.05 | 63.9 | |
| LLaVA-OneVision-7BFrames=32, MLLM Backbone=LLaVA-OneVision-7B2026.06 | 63.7 | |
| DynaTokRetention Ratio R=9.5%, # Newline Tokens M=8322026.05 | 63.2 | |
| VisionZipBase Model=LLaVA-Video-7B, Retention Ratio=10%, Input Frames=642026.04 | 62.9 | |
| TimeChat-Online-7BEvaluation Protocol=vanilla offline2026.05 | 62.9 | |
| DynaTokRetention Ratio R=25%2026.05 | 62.5 | |
| InternVL3-8BFrames=82026.05 | 62.2 | |
| DyCokeRetention Ratio R=32.5%2026.05 | 62.1 | |
| DynaTokRetention Ratio R=19.9%2026.05 | 62.1 | |
| DynaTokRetention Ratio R=14.8%2026.05 | 62.1 | |
| VisionZipRetention Ratio R=24.9%, # Newline Tokens M=642026.05 | 62.1 | |
| Dispider-7B#Frames=1fps2025.08 | 61.7 | |
| Dispider-7BEvaluation Protocol=vanilla offline2026.05 | 61.7 | |
| Video-R1-7BSetting=reasoning-enhanced setting (<think>→<answer>)2026.05 | 61.6 | |
| FastVRetention Ratio R=100%/25%2026.05 | 61.5 | |
| FastVRetention Ratio R=100%/20%2026.05 | 61.2 | |
| TangoBase Model=Qwen2.5-VL-7B, Retention Ratio=20%, Input Frames=322026.04 | 61 | |
| Kangaroo-7BEvaluation Protocol=vanilla offline2026.05 | 61 | |
| KangarooSize=8B2026.05 | 61 | |
| VisionZipBase Model=Qwen2.5-VL-7B, Retention Ratio=20%, Input Frames=322026.04 | 60.6 |