Video Understanding on MLVU
87.34AccuracyGPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5tier=High2026.02 | 87.34 | — | — | |
| Qwen3-VLSize=8B, Frames=2fps, Input tokens=> 125442026.03 | 78.1 | — | — | |
| Gemini 3-Pro2026.02 | 76.3 | — | — | |
| Gemini 2.5-Pro2026.02 | 76.1 | — | — | |
| InternVL-2.5-26B + LUVCBackbone=InternVL-2.5-26B, Red. Ratio=61.32%, Latency=1.2255, Speedup=2.38x2025.12 | 75.23 | — | — | |
| InternVL-2.5-26B (Reproduction)Backbone=InternVL-2.5-26B, Red. Ratio=0.00%, Latency=2.9142, Speedup=-2025.12 | 75.11 | — | — | |
| InternVL-2.5-26B + PACTBackbone=InternVL-2.5-26B, Red. Ratio=59.61%, Latency=1.3548, Speedup=2.15x2025.12 | 73.96 | — | — | |
| InternVL-2.5-26B + VTWBackbone=InternVL-2.5-26B, Red. Ratio=66.67%, Latency=1.2586, Speedup=2.32x2025.12 | 73 | — | — | |
| LLaVA-Video + ForestPruneSize=7B, Frames=256, Input tokens=10816, Pruning Ratio=75%2026.03 | 72.5 | — | — | |
| InternVL-2.5-8B + LUVCBackbone=InternVL-2.5-8B, Red. Ratio=62.12%, Latency=0.6293, Speedup=1.98x2025.12 | 72.49 | — | — | |
| InternVL-2.5-26BBackbone=InternVL-2.5-26B, Red. Ratio=0.00%, Latency=2.9142, Speedup=-2025.12 | 72.3 | — | — | |
| ERNIE 5.02026.02 | 72.24 | — | — | |
| LLaVA-Video + ForestPruneSize=7B, Frames=512, Input tokens=10816, Pruning Ratio=87.5%2026.03 | 72.2 | — | — | |
| InternVL-2.5-8B (Reproduction)Backbone=InternVL-2.5-8B, Red. Ratio=0.00%, Latency=1.2480, Speedup=-2025.12 | 71.8 | — | — | |
| GLM-4.1VSize=9B, Frames=64, Input tokens=163842026.03 | 71.5 | — | — | |
| InternVL3Size=8B, Frames=64, Input tokens=163842026.03 | 71.4 | — | — | |
| LLaVA-VideoSize=7B, Frames=64, Input tokens=108162026.03 | 71.3 | — | — | |
| Qwen3-VLmode=Thinking2026.02 | 71.1 | — | — | |
| LLaVA-Video + ForestPruneSize=7B, Frames=128, Input tokens=10816, Pruning Ratio=50%2026.03 | 70.5 | — | — | |
| InternVL3.5Size=8B, Frames=64, Input tokens=163842026.03 | 70.2 | — | — | |
| InternVL-2.5-8B + PACTBackbone=InternVL-2.5-8B, Red. Ratio=55.41%, Latency=0.6949, Speedup=1.80x2025.12 | 70.15 | — | — | |
| Qwen2.5-VLSize=7B, Frames=64, Input tokens=> 125442026.03 | 69.6 | — | — | |
| InternVL-2.5-8B + VTWBackbone=InternVL-2.5-8B, Red. Ratio=56.25%, Latency=0.6482, Speedup=1.93x2025.12 | 69.32 | — | — | |
| InternVL-2.5-8BBackbone=InternVL-2.5-8B, Red. Ratio=0.00%, Latency=1.2480, Speedup=-2025.12 | 68.9 | — | — | |
| Qwen2.5-Omni-7BModel Size=7B, Est. Tokens Per Min=10,1402025.12 | 68.4 | — | — | |
| EchoingPixelsModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 68.3 | — | — | |
| EVA-GRPOFrame=22.2*2026.03 | 68.3 | — | — | |
| EchoingPixelsModel Size=3B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 67.4 | — | — | |
| Qwen2.5-Omni-3BModel Size=3B, Est. Tokens Per Min=10,1402025.12 | 67.2 | — | — | |
| EchoingPixelsModel Size=3B, Token Budget=5%, Est. Tokens Per Min=5072025.12 | 66.1 | — | — | |
| IntraModalModel Size=7B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 65 | — | — | |
| LLaVA-OVLLM Backbone=Qwen2-7B, Open Data=true2025.12 | 64.7 | — | — | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true2025.12 | 64.7 | — | — | |
| LlavaOV-7BBackbone=LlavaOV-7B, Red. Ratio=0.00%, Latency=0.5194, Speedup=-2025.12 | 64.7 | — | — | |
| LlavaOV-7B + PACTBackbone=LlavaOV-7B, Red. Ratio=55.88%, Latency=0.2711, Speedup=1.92x2025.12 | 64.7 | — | — | |
| GPT-4oLLM Backbone=N/A, Open Data=false2025.12 | 64.6 | — | — | |
| GPT-4oFrame=0.5 fps2026.03 | 64.6 | — | — | |
| LlavaOV-7B + LUVCBackbone=LlavaOV-7B, Red. Ratio=62.32%, Latency=0.2583, Speedup=2.01x2025.12 | 63.77 | — | — | |
| IntraModalModel Size=3B, Token Budget=25%, Est. Tokens Per Min=2,5352025.12 | 63.4 | — | — | |
| MECoT2025.12 | 63.28 | — | — | |
| LV-OV2025.12 | 63.17 | — | — | |
| EchoingPixelsModel Size=7B, Token Budget=10%, Est. Tokens Per Min=1,0142025.12 | 62.9 | — | — | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true2025.12 | 61.1 | — | — | |
| LlavaOV-7B + FastVBackbone=LlavaOV-7B, Red. Ratio=42.86%, Latency=0.2693, Speedup=1.93x2025.12 | 60.87 | — | — | |
| Video-R1Frame=322026.03 | 60.2 | — | — | |
| LLaDA-VLLM Backbone=LLaDA 8B, Open Data=true2025.12 | 59.4 | — | — | |
| FastVModel Size=7B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 59.4 | — | — | |
| FrameThinkerFrame=23.22026.03 | 59.1 | — | — | |
| VideoLLaMA2Model Size=7B, Est. Tokens Per Min=∼4,1522025.12 | 58.5 | — | — | |
| EVA-KTOFrame=28.7*2026.03 | 57.4 | — | — | |
| InternVL2.5Arch.=Dense, # activated=1B, # total=1B2026.03 | 57.3 | — | — | |
| FastVModel Size=3B, Token Budget=20%, Est. Tokens Per Min=2,0282025.12 | 56.3 | — | — | |
| LongVAFrame=2562026.03 | 56.3 | — | — | |
| VideoLLaMA 2.1 + SF2TBackbone=VideoLLaMA 2.1, Training Configuration=Base+SF2T2025.04 | 56.11 | — | — | |
| LongVULLM Backbone=Llama3.2-3B2024.10 | 55.9 | — | — | |
| MiniCPM-V 2.6 + SF2TBackbone=MiniCPM-V 2.6, Training Configuration=Base+SF2T2025.04 | 55.32 | — | — | |
| Qwen2-VL + SF2TBackbone=Qwen2-VL, Training Configuration=Base+SF2T2025.04 | 54.67 | — | — | |
| VideoChat-R1Frame=322026.03 | 54.3 | — | — | |
| InternVL3.5 + MoE-GRPO (ours)Arch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=MoE-GRPO2026.03 | 53.1 | — | — | |
| VideoLLaMA 2.1Backbone=VideoLLaMA 2.1, Training Configuration=Base2025.04 | 52.32 | — | — | |
| EVA-SFTFrame=46.7*2026.03 | 52.3 | — | — | |
| InternVL2Arch.=Dense, # activated=1B, # total=1B2026.03 | 51.6 | — | — | |
| InternVL3.5 + Stoch-FT-NoiseArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Stochastic Fine-Tuning with Gaussian Noise2026.03 | 51.1 | — | — | |
| LlavaOV-7B + VTWBackbone=LlavaOV-7B, Red. Ratio=57.14%, Latency=0.2524, Speedup=2.06x2025.12 | 50.36 | — | — | |
| LlavaOV-0.5BBackbone=LlavaOV-0.5B, Red. Ratio=0.00%, Latency=0.0772, Speedup=-2025.12 | 50.3 | — | — | |
| LLaVA-OVArch.=Dense, # activated=1B, # total=1B2026.03 | 50.3 | — | — | |
| InternVL3.5 + Stoch-FT-MultiArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Stochastic Fine-Tuning with Multinomial Sampling2026.03 | 50.3 | — | — | |
| GPT-4V/4TSize=-, Frames=10, Input tokens=-2026.03 | 49.2 | — | — | |
| InternVL3.5 + Det-FTArch.=MoE, # activated=1.3B, # total=2.9B, Fine-tuning strategy=Deterministic Fine-Tuning2026.03 | 48.6 | — | — | |
| Qwen2.5-VLFrame=322026.03 | 48.4 | — | — | |
| ShareGPT4VideoFrame=162026.03 | 46.4 | — | — | |
| LlavaOV-0.5B + LUVCBackbone=LlavaOV-0.5B, Red. Ratio=58.46%, Latency=0.0610, Speedup=1.27x2025.12 | 44.88 | — | — | |
| LlavaOV-0.5B (Reproduction)Backbone=LlavaOV-0.5B, Red. Ratio=0.00%, Latency=0.0772, Speedup=-2025.12 | 44.13 | — | — | |
| LlavaOV-0.5B + FastVBackbone=LlavaOV-0.5B, Red. Ratio=41.67%, Latency=0.0711, Speedup=1.00x2025.12 | 43.72 | — | — | |
| Qwen2-VLBackbone=Qwen2-VL, Training Configuration=Base2025.04 | 42.81 | — | — | |
| LLaVA-NeXT-Video + SF2TBackbone=LLaVA-NeXT-Video, Training Configuration=Base+SF2T2025.04 | 41.91 | — | — | |
| LlavaOV-0.5B + PACTBackbone=LlavaOV-0.5B, Red. Ratio=48.05%, Latency=0.0642, Speedup=1.20x2025.12 | 41.76 | — | — | |
| MiniCPM-V 2.6Backbone=MiniCPM-V 2.6, Training Configuration=Base2025.04 | 41.58 | — | — | |
| LlavaOV-0.5B + VTWBackbone=LlavaOV-0.5B, Red. Ratio=54.17%, Latency=0.0596, Speedup=1.30x2025.12 | 41.24 | — | — | |
| LLaVA-NeXT-VideoBackbone=LLaVA-NeXT-Video, Training Configuration=Base2025.04 | 36.32 | — | — | |
| AVS + SVC2026.02 | — | 59.6 | — | |
| Chat-UniViSize=7B2024.12 | — | 35.8 | — | |
| GPT-4o2026.02 | — | 54.9 | — | |
| GPT-4oAccess=Proprietary2025.12 | — | 64.6 | — | |
| GPT-4oProprietary=true2025.12 | — | 64.6 | — | |
| GPT-4VProprietary=true2025.12 | — | 49.2 | — | |
| GPT4-oSize=Undisclosed2026.02 | — | — | 64.6 | |
| GPT4-VSize=Undisclosed2026.02 | — | — | 49.2 | |
| InternVideo2.5*Size=8B, Frames=5122026.02 | — | — | 72.8 | |
| InternVL-2-4BParameters=4B2025.12 | — | 58 | — | |
| InternVL-2-8BParameters=8B2025.12 | — | 61.5 | — | |
| InternVL-2.5-4BParameters=4B2025.12 | — | 66.7 | — | |
| InternVL-2.5-8BParameters=8B2025.12 | — | 67.2 | — | |
| InternVL2Size=76B, Frames=162026.02 | — | — | 69.9 | |
| InternVL2.5Size=8B, Frames=642026.02 | — | — | 68.9 | |
| InternVL2.5Access=Open-Source, Model Scale=7B-8B2025.12 | — | 68.9 | — | |
| InternVL2.5*Size=8B, Frames=5122026.02 | — | — | 67.6 | |
| InternVL3Size=8B, Frames=642026.02 | — | — | 71.4 | |
| InternVL3*Size=8B, Frames=5122026.02 | — | — | 71.4 | |
| KangarooSize=8B, Frames=642026.02 | — | — | 61 |