Multi-modal Video Understanding on MVBench
79.4ScoreFull Model
Evaluation Results
| Method | Links | ||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Full ModelBackbone=LLaVA-OneVision, Sparsity Ratio=0%2026.04 | 79.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TopoVLMBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 77.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ECoFLaPBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 76.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseGPTBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TAMPBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 75.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLM-StreamlineBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 74.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| WandaBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VCDBase Model=InternVL3.5-14B2026.04 | 71.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DTRBase Model=InternVL3.5-14B2026.04 | 70.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLM-PrunerBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 70.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-14BBase Model=InternVL3.5-14B2026.04 | 70.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DINO-HEALBase Model=InternVL3.5-14B2026.04 | 70.38 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TCDBase Model=InternVL3.5-14B2026.04 | 69.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OWLBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 69.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLCategory=Und. Only Models2026.06 | 68.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaRetention Ratio R=100%2026.02 | 68 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVRetention Ratio R=25%2026.02 | 67.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipRetention Ratio R=25%2026.02 | 67.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDRetention Ratio R=25%2026.02 | 67.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDRetention Ratio R=15%2026.02 | 66.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipRetention Ratio R=15%2026.02 | 66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVRetention Ratio R=15%2026.02 | 65.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDRetention Ratio R=25%2026.02 | 65.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDRetention Ratio R=15%2026.02 | 63.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniARCategory=Unified Models2026.06 | 62.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA-Video, Retention Ratio R=100%2026.02 | 61.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Video-7BBackbone=LLaVA-Video-7B, FLOPs (T)=80.9, FLOPs Ratio=100%, Retention Ratio=100%2026.03 | 60.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 60.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 59.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 59.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-Video, Retention Ratio R=10%2026.02 | 59.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-Video, Retention Ratio R=10%2026.02 | 59.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-Video, Retention Ratio R=10%2026.02 | 58.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA-OneVision, Retention Ratio R=100%2026.02 | 58.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-OneVision, Retention Ratio R=20%2026.02 | 58.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-OneVision, Retention Ratio R=15%2026.02 | 58.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-OneVision, Retention Ratio R=25%2026.02 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-OneVision, Retention Ratio R=20%2026.02 | 58.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-OneVision, Retention Ratio R=25%2026.02 | 58 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-OneVision, Retention Ratio R=15%2026.02 | 57.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-OneVision, Retention Ratio R=25%2026.02 | 57.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-OneVision, Retention Ratio R=20%2026.02 | 57.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlashVIDBase Model=LLaVA-OneVision, Retention Ratio R=10%2026.02 | 57.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVIDBase Model=LLaVA-OneVision, Retention Ratio R=10%2026.02 | 57 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PruneVIDBase Model=LLaVA-OneVision, Retention Ratio R=25%2026.02 | 56.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OVCategory=Und. Only Models2026.06 | 56.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-OneVision, Retention Ratio R=25%2026.02 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Show-o2Category=Unified Models2026.06 | 56.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PruneVIDBase Model=LLaVA-OneVision, Retention Ratio R=20%2026.02 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-Video, Retention Ratio R=10%2026.02 | 56.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-OneVision, Retention Ratio R=20%2026.02 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PruneVIDBase Model=LLaVA-OneVision, Retention Ratio R=15%2026.02 | 55.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-OneVision, Retention Ratio R=15%2026.02 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-OneVision, Retention Ratio R=10%2026.02 | 54.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PruneVIDBase Model=LLaVA-OneVision, Retention Ratio R=10%2026.02 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA-OneVision, Retention Ratio R=15%2026.02 | 53.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBase Model=LLaVA-OneVision, Retention Ratio R=10%2026.02 | 53.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-Video-7B, FLOPs (T)=1.4, FLOPs Ratio=1.7%, Retention Ratio=2%/1%2026.03 | 50.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-Video-7B, FLOPs (T)=1.4, FLOPs Ratio=1.7%, Retention Ratio=2%/1%2026.03 | 50.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 49.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 48.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-Video-7B, FLOPs (T)=1.1, FLOPs Ratio=1.4%, Retention Ratio=1%/0.5%2026.03 | 48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 47.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-0.5BBackbone=LLaVA-OV-0.5B, FLOPs (T)=3.54, FLOPs Ratio=100%, Retention Ratio=100%2026.03 | 46.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-Video-7B, FLOPs (T)=1.1, FLOPs Ratio=1.4%, Retention Ratio=1%/0.5%2026.03 | 46.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-Video-7B, FLOPs (T)=1.5, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 43.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 43.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FsatVBackbone=LLaVA-Video-7B, FLOPs (T)=10.2, FLOPs Ratio=12.6%, Retention Ratio=100%/2%2026.03 | 42.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.06, FLOPs Ratio=1.8%, Retention Ratio=2%/1%2026.03 | 42.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.06, FLOPs Ratio=1.8%, Retention Ratio=2%/1%2026.03 | 42.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-Video-7B, FLOPs (T)=1.2, FLOPs Ratio=1.5%, Retention Ratio=1%2026.03 | 42.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FsatVBackbone=LLaVA-Video-7B, FLOPs (T)=9.7, FLOPs Ratio=11.9%, Retention Ratio=100%/1%2026.03 | 42.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OursBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%/0.5%2026.03 | 42.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours (w/o M)Backbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 41.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoliTomBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%/0.5%2026.03 | 41.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.50, FLOPs Ratio=14.1%, Retention Ratio=100%/2%2026.03 | 39.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 37.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.07, FLOPs Ratio=1.9%, Retention Ratio=2%2026.03 | 36.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVidBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 36.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.48, FLOPs Ratio=13.7%, Retention Ratio=100%/1%2026.03 | 35.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=LLaVA-OV-0.5B, FLOPs (T)=0.05, FLOPs Ratio=1.3%, Retention Ratio=1%2026.03 | 35.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MagnitudeBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 19.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| APPOSize=7B, Training Data=34K, Resolution=224 x 224, Sampling Rate (fps)=1fps, Maximum Frames=30, Zero-shot evaluation=true2026.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 64.6 | — | |
| CoF-InternVL2.5-4BParameters=4B2025.05 | — | 64.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 76.1 | — | |
| CoF-InternVL3-8BParameters=8B2025.05 | — | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.1 | — | |
| DeepVideo-R1Arch.=Dense, # activated=3B, # total=3B2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 49.6 | — | |
| E.M.Ground2026.02 | — | 42 | 73 | 50 | 39 | 33.5 | 35.5 | 39 | 32 | 32.5 | 51 | 30.5 | 39.5 | 37 | 33.5 | 26 | 48 | 40 | 34.5 | 67.5 | 40.5 | 60 | — | — | |
| E.T.Chat2026.02 | — | 37.1 | 59.5 | 28 | 38.5 | 33.5 | 34.5 | 31 | 22.5 | 27 | 49 | 29.5 | 38 | 36.5 | 26 | 24.5 | 51 | 33 | 32.5 | 52.5 | 37.5 | 60 | — | — | |
| ECoFLaPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 54.2 | 93.8 | |
| Flash-VStream-7BCategory=Open-source Online Models, Model Size=7B2025.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 61.2 | — | |
| Full ModelBackbone=VideoLLaMA2 (7B), Sparsity Ratio=0%, Evaluation Protocol=Zero-shot2026.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58.4 | 100 | |
| G2F-RAGSize=4B, Base Model=InternVL3.52026.04 | — | 74.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G2F-RAGSize=7B, Base Model=LLaVA-Video2026.04 | — | 68.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G2F-RAGSize=7B, Base Model=Qwen2.5-VL2026.04 | — | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G2F-RAGSize=8B, Base Model=InternVL3.52026.04 | — | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| G2F-RAGSize=14B, Base Model=InternVL3.52026.04 | — | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-proCategory=Proprietary Models2025.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 60.5 | — | |
| Gemini-2.5-Pro (minimal)Size=-2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 82.9 | — |