Multimodal Video Understanding on VideoMMMU
61.2Overall ScoreGPT-4o
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-4oModel=GPT-4o2025.10 | 61.2 | 66 | — | — | |
| GPT-4o2026.06 | 61.2 | 66 | — | — | |
| EchoPruneBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 58 | 74.3 | 61.3 | 38.3 | |
| Qwen3VL-8BBackbone=Qwen3VL-8B, Setting=F322026.05 | 57.6 | 73 | 64 | 35.7 | |
| FlashVIDBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 55.6 | 71.7 | 58.7 | 36.3 | |
| VideoR1-7BModel=VideoR1-7B2025.10 | 52.4 | 65.3 | — | — | |
| VideoR1-7BParameters=7B2026.06 | 52.4 | 65.3 | — | — | |
| Open-o3-Video-7B (Ours)Model=Open-o3-Video-7B (Ours)2025.10 | 52.3 | 68 | — | — | |
| Open-o3-Video2026.06 | 52.3 | 68 | — | — | |
| SER-7BParameters=7B2026.06 | 51.4 | 67.4 | — | — | |
| Qwen2.5-VL-7B (Base)Model=Qwen2.5-VL-7B (Base)2025.10 | 51.2 | 64.7 | — | — | |
| Qwen2.5-VL-7BParameters=7B, Model Version=Base model2026.06 | 51.2 | 64.7 | — | — | |
| VideoRFT-7BModel=VideoRFT-7B2025.10 | 51.1 | 66 | — | — | |
| VideoRFT-7BParameters=7B2026.06 | 51.1 | 66 | — | — | |
| VisionZipBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 50.9 | 68.1 | 56.2 | 28.4 | |
| MI-PrunerBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 50.3 | 67.7 | 55 | 28.3 | |
| VideoLLaMA3-7BModel=VideoLLaMA3-7B2025.10 | 46.5 | 59.7 | — | — | |
| VideoLLaMA3-7BParameters=7B2026.06 | 46.5 | 59.7 | — | — | |
| InternVL-2.5-8BModel=InternVL-2.5-8B2025.10 | 42.4 | 57 | — | — | |
| InternVL-2.5-8BParameters=8B2026.06 | 42.4 | 57 | — | — | |
| EchoPruneBackbone=Qwen3VL-2B, Setting=F160/20%2026.05 | 41.7 | 56.7 | 40.7 | 27.7 | |
| Qwen3VL-2BBackbone=Qwen3VL-2B, Setting=F322026.05 | 41.3 | 55 | 43 | 26 | |
| VisionZipBackbone=Qwen3VL-2B, Setting=F160/20%2026.05 | 37.4 | 48.6 | 36.6 | 27.1 | |
| MI-PrunerBackbone=Qwen3VL-2B, Setting=F160/20%2026.05 | 36.9 | 48.7 | 35.3 | 26.7 | |
| FlashVIDBackbone=Qwen3VL-2B, Setting=F160/20%2026.05 | 34.8 | 45 | 37.3 | 22 |