General Video Understanding on MVBench Overall
86.03AccuracyPyraTok
Evaluation Results
| Method | Links | |
|---|---|---|
| PyraTokVAE=true2026.01 | 86.03 | |
| LARPVAE=true2026.01 | 83.21 | |
| VILA-UVAE=true2026.01 | 81.21 | |
| OmniTokenizerVAE=true2026.01 | 79.44 | |
| InternVL3-78BVAE=false2026.01 | 79.2 | |
| InternVL3-38BVAE=false2026.01 | 76 | |
| Qwen2.5-72BVAE=false2026.01 | 71.3 | |
| SlowFast + PASInference Strategy=SlowFast stacked with PAS2025.11 | 71 | |
| TS-LLaVA + PASInference Strategy=TS-LLaVA stacked with PAS2025.11 | 70.1 | |
| PASInference Strategy=Phase Aggregated Smoothing (Ours)2025.11 | 69.5 | |
| SlowFast-LLaVAInference Strategy=SlowFast2025.11 | 69.2 | |
| TS-LLaVAInference Strategy=TS-LLaVA2025.11 | 67.8 | |
| Qwen2.5VL-7BVAE=false2026.01 | 67.2 | |
| Default SettingInference Strategy=Default Setting, Backbone=Qwen2.5-VL-7B-Instruct2025.11 | 67.2 | |
| Qwen2.5VL-3BVAE=false2026.01 | 67 | |
| DTRBase Model=Qwen3-VL-8B2026.04 | 66.83 | |
| TCDBase Model=Qwen3-VL-8B2026.04 | 66.67 | |
| DINO-HEALBase Model=Qwen3-VL-8B2026.04 | 66.17 | |
| VideoCFRFrames=162026.06 | 66.1 | |
| BaselineBase Model=Qwen3-VL-8B2026.04 | 66 | |
| VCDBase Model=Qwen3-VL-8B2026.04 | 65.6 | |
| VideoCFRFrames=322026.06 | 64.5 | |
| VideoChat-R1Frames=162026.06 | 64.2 | |
| VideoCFRFrames=642026.06 | 63.9 | |
| Video-R1-7BFrames=162026.06 | 62.4 | |
| VIDEORFTFrames=322026.06 | 62.1 | |
| Kangeroo-8B2026.06 | 61.1 | |
| Qwen2.5-VL-7B2026.06 | 59.4 | |
| DTRBase Model=Qwen2.5-VL-7B2026.04 | 59.25 | |
| DINO-HEALBase Model=Qwen2.5-VL-7B2026.04 | 58.93 | |
| BaselineBase Model=Qwen2.5-VL-7B2026.04 | 58.9 | |
| Video-UTR-7B2026.06 | 58.8 | |
| TCDBase Model=Qwen2.5-VL-7B2026.04 | 58.55 | |
| VCDBase Model=Qwen2.5-VL-7B2026.04 | 57.2 | |
| LLaVA-OneVision-7B2026.06 | 56.7 | |
| VideoLLaMA22026.06 | 54.6 | |
| DeepVideo-R12026.06 | 49.6 | |
| MARC-3BFrames=12026.06 | 45.8 | |
| LLaMA-VID2026.06 | 41.9 |