Video Understanding on VideoMME (Length Segmentation)
75Score (Overall)Gemini-1.5-Pro
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Gemini-1.5-ProFrame=0.5fps2026.03 | 75 | — | — | 67.4 | — | |
| Gemini-1.5-proEvaluation Protocol=vanilla offline, Model Type=Proprietary2026.05 | 75 | 81.7 | 74.3 | 67.4 | — | |
| FullModel=Qwen3-VL-30B-A3B-Instruct2026.03 | 72.11 | 81.11 | 71.44 | 63.78 | — | |
| FlashPrefillModel=Qwen3-VL-30B-A3B-Instruct2026.03 | 72 | 80.78 | 71.89 | 63.33 | — | |
| GPT-4oModel Category=Proprietary2026.03 | 71.9 | — | — | — | — | |
| GPT-4o2026.03 | 71.9 | — | — | — | — | |
| GPT-4oFrame=3842026.03 | 71.9 | — | — | 65.3 | — | |
| GPT-4oEvaluation Protocol=vanilla offline, Model Type=Proprietary2026.05 | 71.9 | 80 | 70.3 | 65.3 | — | |
| MInferenceModel=Qwen3-VL-30B-A3B-Instruct2026.03 | 71.22 | 79.89 | 70.89 | 62.89 | — | |
| FlexPrefillModel=Qwen3-VL-30B-A3B-Instruct2026.03 | 71.01 | 79.33 | 71 | 62.67 | — | |
| XAttentionModel=Qwen3-VL-30B-A3B-Instruct2026.03 | 70.61 | 79.67 | 70.11 | 62.06 | — | |
| Open-o3 + MCoT2026.03 | 69.7 | — | — | 60.3 | — | |
| Qwen3-VL-8BRetention Ratio γ=100%2026.04 | 68.7 | 79.9 | 67 | 59.1 | — | |
| V-CASTBase Model=Qwen3-VL-30B-A3B-Instruct, Retention Ratio=25%, Input Frames=642026.03 | 68.2 | 78.9 | 65.9 | 59.8 | — | |
| VidCom2Base Model=Qwen3-VL-30B-A3B-Instruct, Retention Ratio=25%, Input Frames=642026.03 | 68.1 | 79.1 | 68 | 58.9 | — | |
| Motion-o2026.03 | 67.5 | — | — | 58.6 | — | |
| MI-PrunerBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 67.1 | 77.4 | 66.8 | 57.1 | — | |
| Qwen3-VL-8B-InstructMax Input Frames=64, Retention Ratio=100.0%2026.03 | 66.9 | 78.8 | 66.2 | 55.8 | — | |
| EchoPruneBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 66.7 | 75.2 | 67.8 | 57.1 | — | |
| VisionZipBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 66.5 | 77.2 | 65.9 | 56.5 | — | |
| Full TokensBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=100%, Frame Budgets=1282026.05 | 66.44 | 77.1 | 66.8 | 55.4 | — | |
| OmniSelectBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=45%, Frame Budgets=1282026.05 | 66.33 | 74.9 | 67.7 | 56.4 | — | |
| Open-o3 + MCoTgrounding reward=false2026.03 | 66.3 | — | — | 57.3 | — | |
| VidCom2Retention Ratio γ=25%2026.04 | 66.3 | 76.2 | 65 | 57.8 | — | |
| Video-LLaMA3-7BEvaluation Protocol=vanilla offline, Model Type=Open-source Offline2026.05 | 66.2 | 80.1 | 63.7 | 54.9 | — | |
| LongVT-RL-7BModel Category=Tool-calling, Model Scale=7B2026.03 | 66.1 | — | — | — | — | |
| OmniZipBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=45%, Frame Budgets=1282026.05 | 66.03 | 75.4 | 67.2 | 55.4 | — | |
| FlashVIDBackbone=Qwen3VL-8B, Setting=F160/20%2026.05 | 65.9 | 77 | 65.7 | 55.1 | — | |
| KiTokeRetention Ratio γ=25%2026.04 | 65.8 | 77.6 | 63.9 | 56 | — | |
| OmniZipBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=30%, Frame Budgets=1282026.05 | 65.48 | 73.8 | 66.3 | 56.3 | — | |
| OmniSelectBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=30%, Frame Budgets=1282026.05 | 65.48 | 73.8 | 66.3 | 56.3 | — | |
| VisionZipRetention Ratio γ=25%2026.04 | 65.4 | 76.4 | 62.8 | 56.9 | — | |
| DyCoke (V&A)Backbone=Qwen2.5-Omni-7B, Retained Ratio (%)=50%, Frame Budgets=1282026.05 | 65.15 | 73.9 | 66.4 | 55.1 | — | |
| V-CASTMax Input Frames=64, Retention Ratio=25%2026.03 | 65.1 | 76.8 | 63.2 | 55.3 | — | |
| RandomBackbone=Qwen2.5-Omni-7B, Retained Ratio (%)=55%, Frame Budgets=1282026.05 | 65.07 | 73.9 | 66.6 | 55.3 | — | |
| VidCom2Max Input Frames=64, Retention Ratio=25%2026.03 | 64.9 | 75.4 | 63.4 | 55.9 | — | |
| InternVL-V3.5-8BEvaluation Protocol=vanilla offline, Model Type=EvoStreaming Framework2026.05 | 64.7 | 77.4 | 63.1 | 53.4 | — | |
| HoliTomBase Model=Qwen3-VL-30B-A3B-Instruct, Retention Ratio=25%, Input Frames=642026.03 | 64.6 | 73.6 | 63.9 | 56.2 | — | |
| Qwen3-VL-8B-InstructMax Input Frames=32, Retention Ratio=100.0%2026.03 | 64.5 | 76 | 60.4 | 57 | — | |
| VanillaBase Model=LLaVA-Video, Retention Ratio R=100%2026.02 | 64.2 | 77 | 62.1 | 53.3 | — | |
| VanillaRetention Ratio R=100%2026.02 | 64.2 | 77 | 62.1 | 53.3 | — | |
| Motion-ogrounding reward=false2026.03 | 64.2 | — | — | 55.5 | — | |
| LLaVA-Video-7BRetention Ratio γ=100%2026.04 | 64.2 | 77.2 | 62.2 | 53.1 | — | |
| InternVL-V2.5-8BEvaluation Protocol=vanilla offline, Model Type=Open-source Offline2026.05 | 64.2 | — | — | — | — | |
| LLaVA-Video-7BBackbone=LLaVA-Video-7B, Token Retention Ratio=100%2026.06 | 64.2 | 77 | 62.1 | 53.3 | — | |
| LLaVA-Video 7BRetention Ratio R=100%, # Newline Tokens M=8322026.05 | 64.1 | 76.9 | — | 53.4 | — | |
| DyCokeRetention Ratio γ=25%2026.04 | 64 | 75.4 | 62.3 | 54.2 | — | |
| OmniSelectBackbone=Qwen2.5-Omni-3B, Retained Ratio (%)=45%, Frame Budgets=1282026.05 | 63.93 | 73.4 | 65 | 53.3 | — | |
| V-CASTMax Input Frames=64, Retention Ratio=15%2026.03 | 63.9 | 76.3 | 61.4 | 53.8 | — | |
| Full TokensBackbone=Qwen2.5-Omni-3B, Retained Ratio (%)=100%, Frame Budgets=1282026.05 | 63.89 | 74.8 | 64.1 | 52.8 | — | |
| Qwen3VL-8BBackbone=Qwen3VL-8B, Setting=F322026.05 | 63.8 | 75 | 59.8 | 56.6 | — | |
| ST-SimDiffBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 63.8 | 76.2 | 62.4 | 52.7 | — | |
| FullModel=Qwen2.5-VL-7B-Instruct2026.03 | 63.74 | 75.78 | 62.33 | 53.11 | — | |
| OmniZipBackbone=Qwen2.5-Omni-3B, Retained Ratio (%)=45%, Frame Budgets=1282026.05 | 63.74 | 74 | 64.6 | 52.7 | — | |
| FastVIDRetention Ratio γ=25%2026.04 | 63.7 | 75.2 | 62.6 | 53.4 | — | |
| Open-o3 Video2026.03 | 63.6 | — | — | 54.9 | — | |
| V-CASTMax Input Frames=32, Retention Ratio=25%2026.03 | 63.5 | 74.4 | 60.2 | 55.8 | — | |
| FastVIDRetention Ratio γ=25%2026.04 | 63.5 | 74.3 | 61.4 | 54.8 | — | |
| EvoStreaming-8B-InternVL-V3.5Evaluation Protocol=vanilla offline, Model Type=EvoStreaming Framework2026.05 | 63.5 | 76.7 | 62 | 51.9 | — | |
| VISIONCOACH-7BModel Category=Tool-free, Model Scale=7B2026.03 | 63.3 | — | — | 53.2 | — | |
| LLaVA-Video-7BEvaluation Protocol=vanilla offline, Model Type=Open-source Offline2026.05 | 63.3 | — | — | — | — | |
| LLaVA-VideoBase Model=LLaVA-Video-7B, Input Frames=64, Mode=Upper Bound (Full Performance)2026.05 | 63.3 | — | — | — | — | |
| FlashPrefillModel=Qwen2.5-VL-7B-Instruct2026.03 | 63.22 | 74.78 | 61.67 | 53.22 | — | |
| Qwen2.5-VL-7B#Frames=1fps2025.08 | 63.2 | — | — | 50.4 | — | |
| ST-SimDiffBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=30%2026.05 | 63.2 | 74.7 | 61.9 | 53 | — | |
| Open-o3-video-7BModel Category=Tool-free, Model Scale=7B2026.03 | 63.1 | — | — | 53.1 | — | |
| VisionZipMax Input Frames=64, Retention Ratio=25%2026.03 | 63.1 | 73.7 | 60.3 | 55.4 | — | |
| VidCom2Max Input Frames=64, Retention Ratio=15%2026.03 | 62.9 | 72.6 | 61.3 | 54.7 | — | |
| StreamAgent-7B#Frames=1fps2025.08 | 62.9 | — | — | 50.6 | — | |
| FastVIDRetention Ratio R=25%2026.02 | 62.8 | 74.7 | 60.1 | 53.6 | — | |
| KiTokeRetention Ratio γ=10%2026.04 | 62.8 | 74.3 | 61.2 | 52.9 | — | |
| HoliTomMax Input Frames=64, Retention Ratio=25%2026.03 | 62.7 | 74.4 | 60.6 | 53.2 | — | |
| VisionZipBase Model=Qwen3-VL-30B-A3B-Instruct, Retention Ratio=25%, Input Frames=642026.03 | 62.7 | 70.7 | 61.3 | 56 | — | |
| FastVIDBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 62.6 | 74.6 | 60.8 | 52.3 | — | |
| FrameFusionBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 62.6 | 74.6 | 61.2 | 52 | — | |
| PruneVIDRetention Ratio γ=25%2026.04 | 62.5 | 72.9 | 60.3 | 54.3 | — | |
| FastVRetention Ratio γ=100%/25%2026.04 | 62.5 | 73.2 | 61.7 | 52.7 | — | |
| TimeChat-Online-7B#Frames=1fps2025.08 | 62.5 | — | — | 49.2 | — | |
| VisionZipRetention Ratio R=25%2026.02 | 62.4 | 74 | 60.3 | 52.9 | — | |
| FlashVIDRetention Ratio R=25%2026.02 | 62.4 | 74.2 | 61.4 | 51.6 | — | |
| Qwen2.5-VL-7BModel Category=Tool-free, Model Scale=7B2026.03 | 62.4 | — | — | 50.8 | — | |
| Qwen2.5-VL-7Bvariant=base2026.03 | 62.4 | — | — | 50.8 | — | |
| VidCom2Max Input Frames=32, Retention Ratio=25%2026.03 | 62.4 | 72.1 | 59.1 | 56.1 | — | |
| FastVIDBase Model=Qwen3-VL-30B-A3B-Instruct, Retention Ratio=25%, Input Frames=642026.03 | 62.4 | 70.3 | 61.6 | 55.2 | — | |
| FastVIDMax Input Frames=64, Retention Ratio=25%2026.03 | 62.3 | 73.9 | 60.7 | 52.2 | — | |
| FlashVIDMax Input Frames=32, Retention Ratio=25%2026.03 | 62.3 | 74.4 | 58.7 | 53.9 | — | |
| FlashVIDBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 62.2 | 74.1 | 60 | 52.3 | — | |
| FastVBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 62.2 | 73.9 | 61.4 | 51.3 | — | |
| FlexPrefillModel=Qwen2.5-VL-7B-Instruct2026.03 | 62.15 | 72.44 | 61.33 | 52.67 | — | |
| DyCoke (V&A)Backbone=Qwen2.5-Omni-3B, Retained Ratio (%)=50%, Frame Budgets=1282026.05 | 62.11 | 71.1 | 62.8 | 52.4 | — | |
| KiTokeRetention Ratio γ=25%2026.04 | 62.1 | 74.6 | 60.8 | 51 | — | |
| DynaTokRetention Ratio R=24.9%, # Newline Tokens M=8322026.05 | 62.1 | 74.1 | — | 51.6 | — | |
| V-CASTMax Input Frames=32, Retention Ratio=15%2026.03 | 62 | 71.9 | 58.3 | 55.9 | — | |
| Qwen2.5-VL-7BEvaluation Protocol=vanilla offline, Model Type=EvoStreaming Framework2026.05 | 62 | 73 | 60.9 | 52.1 | — | |
| EvoStreaming-8B-Qwen2.5Evaluation Protocol=vanilla offline, Model Type=EvoStreaming Framework2026.05 | 61.9 | 73.1 | 61 | 51.4 | — | |
| FlashVIDRetention Ratio R=15%2026.02 | 61.8 | 73.8 | 59.6 | 52.1 | — | |
| VisionZipBase Model=LLaVA-Video, Retention Ratio R=20%2026.02 | 61.7 | 72.3 | 59.6 | 53.3 | — | |
| FasterVLMBase Model=LLaVA-Video-7B, Input Frames=64, Token Retain Ratio (r)=50%2026.05 | 61.7 | 74 | 59.2 | 51.8 | — | |
| VidCom2Retention Ratio γ=10%2026.04 | 61.6 | 70.3 | 59.4 | 54.9 | — | |
| DyCokeRetention Ratio R=32.1%, # Newline Tokens M=2562026.05 | 61.6 | 74.6 | — | 51.1 | — |