Multi-modal Video Understanding on VideoMME
84.3AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-ProSize=-, Evaluation Frames=64, Subtitles=None2026.03 | 84.3 | — | |
| Qwen3-VL-8BModel Category=Open-source General Models2025.11 | 78.1 | — | |
| SenseNova-SIBase Architecture=Qwen3-VL-8B, Model Category=Ours2025.11 | 76.4 | — | |
| InternVL3-8BModel Category=Open-source General Models2025.11 | 76.1 | — | |
| Gemini-1.5-ProSize=-, Evaluation Frames=64, Subtitles=None2026.03 | 75 | — | |
| Gemini-1.5-ProAccess=Closed-source2025.05 | 75 | — | |
| Gemini-1.5-Pro2025.08 | 75 | — | |
| CoF-InternVL3-8BParameters=8B2025.05 | 73.7 | 72.1 | |
| SenseNova-SIBase Architecture=InternVL3-8B, Model Category=Ours2025.11 | 72.2 | — | |
| VST-7B-SFTModel Category=Open-source SI Models2025.11 | 72.1 | — | |
| GPT-4oSize=-, Evaluation Frames=64, Subtitles=None2026.03 | 71.9 | 57.8 | |
| GPT-4oAccess=Closed-source2025.05 | 71.9 | — | |
| GPT-4oTime (s)=1.22025.08 | 71.9 | — | |
| Qwen2-VL-72BAccess=Open-source, Parameters=72B2025.05 | 71.2 | 62.7 | |
| Cambrian-S-7BModel Category=Open-source SI Models2025.11 | 70.6 | — | |
| Gemini-1.5-FlashSize=-, Evaluation Frames=64, Subtitles=None2026.03 | 70.3 | — | |
| InternVL3-2BModel Category=Open-source General Models2025.11 | 69.9 | — | |
| Bagel-7B-MoTModel Category=Open-source General Models2025.11 | 68.9 | — | |
| Insight-V++Size=7B, Evaluation Frames=64, Subtitles=None2026.03 | 67.8 | 54.2 | |
| Insight-VSize=7B, Evaluation Frames=64, Subtitles=None2026.03 | 67.2 | 52.9 | |
| SenseNova-SIBase Architecture=InternVL3-2B, Model Category=Ours2025.11 | 66.6 | — | |
| InternVL3-8BAccess=Open-source, Parameters=8B2025.05 | 66.5 | 67 | |
| VideoLLaMA3Size=7B, Evaluation Frames=64, Subtitles=None2026.03 | 66.2 | — | |
| LLaVA-OneVision-72BAccess=Open-source, Parameters=72B2025.05 | 66.2 | 58 | |
| LLaVA-OVParams (B)=722025.08 | 66.2 | — | |
| Qwen2.5-VLParams (B)=722025.08 | 65.74 | — | |
| Ours:base Qwen2.5Params (B)=14+72, Time (s)=3.22025.08 | 65.58 | — | |
| VideoChat-FlashSize=7B, Evaluation Frames=64, Subtitles=None2026.03 | 65.3 | — | |
| VideoChat-R1Size=7B, Evaluation Frames=64, Subtitles=None2026.03 | 65.2 | — | |
| Qwen2.5-VLSize=7B, Evaluation Frames=64, Subtitles=None2026.03 | 65.1 | 47.3 | |
| SenseNova-SIBase Architecture=Bagel-7B-MoT, Model Category=Ours2025.11 | 64.6 | — | |
| Qwen2.5-OmniParams (B)=7, Time (s)=6.02025.08 | 64.3 | — | |
| InternVL2.5Size=8B, Evaluation Frames=64, Subtitles=None2026.03 | 64.2 | — | |
| LLaVA-VideoSize=7B, Evaluation Frames=64, Subtitles=None2026.03 | 63.3 | — | |
| Qwen2-VL-7BAccess=Open-source, Parameters=7B2025.05 | 63.3 | 58 | |
| Qwen2.5-VLParams (B)=322025.08 | 62.39 | — | |
| Video-R1Size=7B, Evaluation Frames=64, Subtitles=None2026.03 | 61.4 | — | |
| MiniCPM-V 2.6Size=8B, Evaluation Frames=64, Subtitles=None2026.03 | 60.9 | — | |
| IXC2.5Params (B)=72025.08 | 60.6 | — | |
| M2-omniParams (B)=92025.08 | 60.4 | — | |
| GPT-4V/4TAccess=Closed-source2025.05 | 59.9 | — | |
| GPT-4V2025.08 | 59.9 | — | |
| CoF-InternVL2.5-4BParameters=4B2025.05 | 59.7 | 64.6 | |
| VITA1.5Params (B)=7, Time (s)=3.72025.08 | 59.2 | — | |
| Oryx-1.5Size=7B, Evaluation Frames=64, Subtitles=None2026.03 | 58.8 | — | |
| LLaVA-OneVisionSize=7B, Evaluation Frames=64, Subtitles=None2026.03 | 58.2 | — | |
| LLaVA-OneVision-7BAccess=Open-source, Parameters=7B2025.05 | 58.2 | 53.2 | |
| LLaVA-OVParams (B)=72025.08 | 58.2 | — | |
| Qwen2.5-VLParams (B)=72025.08 | 56.62 | — | |
| InternVL2.5-4BAccess=Open-source, Parameters=4B2025.05 | 54.7 | 60.8 | |
| Qwen-VL-Max2025.08 | 51.3 | — | |
| DeepVideo-R1Arch.=Dense, # activated=3B, # total=3B2026.03 | 51.1 | — | |
| InternVL2.5Arch.=Dense, # activated=1B, # total=1B2026.03 | 50.3 | — | |
| LongVAArch.=Dense, # activated=7B, # total=7B2026.03 | 47.9 | — | |
| InternVL3.5 + MoE-GRPO (ours)Arch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=MoE-GRPO2026.03 | 46.6 | — | |
| LLaVA-NeXT-Video-7BAccess=Open-source, Parameters=7B2025.05 | 46.5 | 50.2 | |
| InternVL3.5 + Stoch-FT-MultiArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Stochastic Fine-Tuning with Multinomial Sampling2026.03 | 45.9 | — | |
| InternVL3.5 + Det-FTArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Deterministic Fine-Tuning2026.03 | 45.6 | — | |
| VideoLLaMA2Arch.=Dense, # activated=7B, # total=7B2026.03 | 45.1 | — | |
| InternVL3.5 + Stoch-FT-NoiseArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Stochastic Fine-Tuning with Gaussian Noise2026.03 | 45.1 | — | |
| LLaVA-OVArch.=Dense, # activated=1B, # total=1B2026.03 | 44 | — | |
| Mini-InternVL1.5Arch.=Dense, # activated=2B, # total=2B2026.03 | 42.9 | — | |
| InternVL2Arch.=Dense, # activated=1B, # total=1B2026.03 | 42.6 | — | |
| VideoChat2Arch.=Dense, # activated=7B, # total=7B2026.03 | 33.7 | — |