Video Understanding on MLVU (dev)
70.2MLVU Dev ScoreQwen2.5-VL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-VLScale=7B2026.06 | 70.2 | — | — | |
| Full Model (Qwen2.5-Omni-7B)Model Scale=7B, Token Budget=100%2025.12 | 68.4 | — | — | |
| EchoingPixelsModel Scale=3B, Token Budget=20%2025.12 | 68.3 | — | — | |
| EchoingPixelsModel Scale=3B, Token Budget=10%2025.12 | 67.4 | — | — | |
| HIComLLM Size=7B, Frames=128, Tokens=2624, trained_frames_sampling=322025.03 | 67.2 | — | — | |
| Full Model (Qwen2.5-Omni-3B)Model Scale=3B, Token Budget=100%2025.12 | 67.2 | — | — | |
| LLaVA-VideoLLM Size=7B, Frames=32, Tokens=6272, reproducible=true2025.03 | 66.7 | — | — | |
| EchoingPixelsModel Scale=3B, Token Budget=5%2025.12 | 66.1 | — | — | |
| LLaVA-OneVisionLLM Size=7B, Frames=32, Tokens=6272, reproducible=true2025.03 | 65.3 | — | — | |
| HIComLLM Size=7B, Frames=64, Tokens=1328, trained_frames_sampling=322025.03 | 65.1 | — | — | |
| IntraModalModel Scale=7B, Token Budget=25%2025.12 | 65 | — | — | |
| IntraModalModel Scale=3B, Token Budget=25%2025.12 | 63.4 | — | — | |
| EchoingPixelsModel Scale=7B, Token Budget=10%2025.12 | 62.9 | — | — | |
| HIComLLM Size=7B, Frames=32, Tokens=6802025.03 | 62.8 | — | — | |
| MOSS-Video-PreviewSFT Mode=real-time2026.06 | 61.81 | — | — | |
| MOSS-Video-PreviewSFT Mode=offline2026.06 | 60.32 | — | — | |
| LLaDA-V+OursAttention=Block Approximate Sparse Attention2026.05 | 59.71 | — | — | |
| LLaDA-VAttention=Full-Attention2026.05 | 59.61 | — | — | |
| LongVALLM Size=7B, Frames=128, Tokens=184322025.03 | 56.3 | — | — | |
| LLaDA-V+XAttAttention=XAtt2026.05 | 53.84 | — | — | |
| VideoLLaMA2LLM Size=7B, Frames=16, Tokens=11522025.03 | 48.5 | — | — | |
| LLaDA-V+FlexAttention=Flex2026.05 | 47.91 | — | — | |
| Video-LLaVALLM Size=7B, Frames=8, Tokens=20482025.03 | 47.3 | — | — | |
| LLaMA-VIDLLM Size=7B, Frames=1fps, Tokens=2tps2025.03 | 33.2 | — | — | |
| GPT-4o2024.12 | — | 64.6 | — | |
| GPT-4V2024.12 | — | 60.5 | — | |
| InternVL-2-8BBackbone=8B2024.12 | — | 30.2 | — | |
| LLaVA-OV-72Bvariant=Single-Image (SI), Backbone=72B2024.12 | — | 60.9 | — | |
| LLaVA-OV-72BBackbone=72B2024.12 | — | 66.4 | — | |
| LLaVA-OV-7Bvariant=Single-Image (SI), Backbone=7B2024.12 | — | 60.2 | — | |
| LLaVA-OV-7BBackbone=7B2024.12 | — | 64.7 | — | |
| MA-LMMSize=7B, Frames=10002026.02 | — | — | 36.4 | |
| MAmmoTH-VL-8BBackbone=8B2024.12 | — | 64.7 | — | |
| MiniGPT4-VideoSize=7B, Frames=902026.02 | — | — | 44.5 | |
| Qwen-VL-MaxSize=-, Frames=162026.02 | — | — | 42.2 | |
| Qwen2-VL-7B-Ins.Backbone=7B-Instruct2024.12 | — | 58.6 | — | |
| ShareGPT4VideoSize=8B, Frames=162026.02 | — | — | 46.4 | |
| Video-LLAMA-2Size=13B, Frames=162026.02 | — | — | 35.5 | |
| Video-LLAVASize=7B, Frames=82026.02 | — | — | 47.3 | |
| Video-LLAVA+TiFReSize=7B, Frames=82026.02 | — | — | 48.9 | |
| VideoChat2-VicunaSize=7B, Frames=162026.02 | — | — | 44.5 | |
| VideoLLAMA2-ChatSize=7B, Frames=162026.02 | — | — | 48.5 | |
| VTimeLLMSize=7B, Frames=1002026.02 | — | — | 41.9 |