Video Understanding on MLVU (Score)
78.19ScoreFull-precision
Evaluation Results
| Method | Links | |
|---|---|---|
| Full-precisionModel=Qwen3-VL-8B, Quantization=Full-precision2025.10 | 78.19 | |
| FLoCModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 71.57 | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 70.06 | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 69.5 | |
| FLoCModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 69.09 | |
| InternVL2.5Size=8B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 68.9 | |
| FLoCModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 68.81 | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 68.45 | |
| Full-precisionModel=Qwen3-VL-2B, Quantization=Full-precision2025.10 | 68.34 | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 68.08 | |
| Qwen-2.5-VLSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 67.9 | |
| TimeThinkSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 67.8 | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 67.76 | |
| Video-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 67.7 | |
| TS-LLaVAModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 67.57 | |
| DivPruneModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 67.57 | |
| DyCokeModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 67.53 | |
| LLaVA-Video-7BRetention Ratio γ=100%2026.04 | 67.4 | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 67.31 | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 67.3 | |
| FLoCModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 66.93 | |
| LongVUModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 66.61 | |
| VideoRFTSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 66.6 | |
| KiTokeRetention Ratio γ=25%2026.04 | 66.5 | |
| RandomModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 66.24 | |
| Qwen2.5-VL-GRPOSize=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 66.2 | |
| FLoCModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 66.19 | |
| Qwen2.5-VL-SFTSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 66 | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 65.69 | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 65.52 | |
| FastVRetention Ratio γ=100%/25%2026.04 | 65.5 | |
| DivPruneModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 65.46 | |
| VideoChat-R1.5Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 65.3 | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 65.13 | |
| KiTokeRetention Ratio γ=10%2026.04 | 65.1 | |
| ScissorModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 65.04 | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 64.95 | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 64.77 | |
| LLaVA-OneVision-7BToken Budget=100%2026.04 | 64.7 | |
| TS-LLaVAModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 64.67 | |
| DivPruneModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 64.67 | |
| GPT-4oSize=-, Zero-shot=true, Category=Proprietary Models2026.07 | 64.6 | |
| PruneVidModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 64.54 | |
| FastVIDRetention Ratio γ=25%2026.04 | 64.5 | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 64.44 | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 64.26 | |
| VisionZipRetention Ratio γ=25%2026.04 | 64.2 | |
| FLoCModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 64.08 | |
| TS-LLaVAModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 63.89 | |
| RandomModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 63.8 | |
| PruneVIDRetention Ratio γ=25%2026.04 | 63.7 | |
| LLaVA-OVSize=7B, Zero-shot=true, Category=Supervised Fine-Tuning Models2026.07 | 63.7 | |
| STTMModel=Qwen2.5-VL-7B, Compression Ratio=2^-32025.10 | 63.57 | |
| RandomModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 63.57 | |
| KiTokeRetention Ratio γ=25%2026.04 | 63.4 | |
| LLaVA-OV-7BRetention Ratio γ=100%2026.04 | 63.1 | |
| DyCokeModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 63.02 | |
| LongVUModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 62.97 | |
| FastVIDModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 62.94 | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 62.93 | |
| DyCokeModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 62.6 | |
| KiTokeRetention Ratio γ=5%2026.04 | 62.5 | |
| VideoChat-R1Size=7B, Zero-shot=true, Category=Reinforcement Fine-Tuning Models2026.07 | 62.5 | |
| TS-LLaVAModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 62.37 | |
| KiTokeRetention Ratio γ=10%2026.04 | 62.1 | |
| PruneVidModel=InternVL3-8B, Compression Ratio=2^-32025.10 | 62.05 | |
| DivPruneModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 61.91 | |
| FastVRetention Ratio γ=100%/10%2026.04 | 61.8 | |
| STTMModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 61.73 | |
| STTMModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 61.73 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 61.72 | |
| ScissorModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 61.68 | |
| FastVIDRetention Ratio γ=10%2026.04 | 61.6 | |
| PruneVidModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 61.59 | |
| RandomModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 61.41 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 61.29 | |
| PACTToken Budget=11.1%2026.04 | 61.1 | |
| DivPruneToken Budget=11.1%2026.04 | 61 | |
| PruneVIDRetention Ratio γ=10%2026.04 | 61 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 61 | |
| ScissorModel=Qwen2.5-VL-7B, Compression Ratio=2^-42025.10 | 60.95 | |
| IWPToken Budget=11.1%2026.04 | 60.9 | |
| KiTokeRetention Ratio γ=5%2026.04 | 60.8 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 60.76 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 60.21 | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 60.12 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 60.03 | |
| DyCokeModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 59.98 | |
| LongVUModel=InternVL3-8B, Compression Ratio=2^-52025.10 | 59.52 | |
| PruneVidModel=InternVL3-8B, Compression Ratio=2^-42025.10 | 59.48 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 59.4 | |
| STTMModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 59.25 | |
| ScissorModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 58.74 | |
| VidCom2Retention Ratio γ=25%2026.04 | 58.6 | |
| PruneVidModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 58.51 | |
| LongVUModel=Qwen2.5-VL-7B, Compression Ratio=2^-52025.10 | 58.42 | |
| VisionZipRetention Ratio γ=10%2026.04 | 58.3 | |
| PruneVIDRetention Ratio γ=5%2026.04 | 58.3 | |
| FastVIDRetention Ratio γ=5%2026.04 | 58 | |
| FastVRetention Ratio γ=100%/5%2026.04 | 57.7 |