Video Reasoning on Video-MME
68.4AccuracyOla-7B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Ola-7BReasoning=false, Model Size=7B, Zero-shot=true2026.04 | 68.4 | — | — | — | — | |
| AdaFocusReasoning Mode=AutoThink2026.05 | 68.15 | — | — | — | — | |
| VideoAuto-R1Reasoning Mode=AutoThink2026.05 | 67.3 | — | — | — | — | |
| OPSD+ViCuRModel Scale=8B2026.06 | 66.6 | — | — | — | — | |
| OPD+ViCuRModel Scale=8B2026.06 | 66.6 | — | — | — | — | |
| OPSDModel Scale=8B2026.06 | 66.5 | — | — | — | — | |
| LATENT-VC-9BFrames=642026.07 | 66.1 | — | — | — | — | |
| Qwen2.5-VL-7B (Base)Reasoning Mode=✗2026.05 | 66 | — | — | — | — | |
| OPDModel Scale=8B2026.06 | 66 | — | — | — | — | |
| Base ModelModel Scale=8B2026.06 | 65.9 | — | — | — | — | |
| GRPOModel Scale=8B2026.06 | 65.8 | — | — | — | — | |
| VideoChat-R1.5Reasoning Mode=Think-Only2026.05 | 65.2 | — | — | — | — | |
| Qwen3.5-9BSFT+GRPOFrames=642026.07 | 64.6 | — | — | — | — | |
| AVRTReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 64.1 | — | — | — | — | |
| LATENT-VC-9BFrames=322026.07 | 64 | — | — | — | — | |
| V-RTSReasoning=true, Model Size=7B, Zero-shot=true2026.04 | 63 | — | — | — | — | |
| AVRTReasoning=true, Model Size=3B, Zero-shot=true2026.04 | 62.6 | — | — | — | — | |
| LATENT-VC-9BFrames=162026.07 | 61.9 | — | — | — | — | |
| Video-R1Reasoning Mode=Think-Only2026.05 | 61.8 | — | — | — | — | |
| Qwen3.5-9BSFT+GRPOFrames=322026.07 | 61.6 | — | — | — | — | |
| Video-R1-7BFrames=642026.07 | 61.4 | — | — | — | — | |
| Omni-R1Reasoning=true, Model Size=7B, Zero-shot=true2026.04 | 60.7 | — | — | — | — | |
| Qwen3.5-9BSFT+GRPOFrames=162026.07 | 60.3 | — | — | — | — | |
| VILA-1.5-40BFrames=-2026.07 | 60.1 | — | — | — | — | |
| Video-R1-7BFrames=322026.07 | 59.3 | — | — | — | — | |
| Kimi-VL-ThinkingReasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 58.9 | — | — | — | — | |
| OPD+ViCuRModel Scale=2B2026.06 | 58.6 | — | — | — | — | |
| Base ModelModel Scale=2B2026.06 | 58.2 | — | — | — | — | |
| LLaVA-OneVision-7BFrames=-2026.07 | 58.2 | — | — | — | — | |
| Qwen2.5 OmniReasoning=false, Model Size=7B, Zero-shot=true2026.04 | 58.1 | — | — | — | — | |
| GRPOModel Scale=2B2026.06 | 58 | — | — | — | — | |
| OPSDModel Scale=2B2026.06 | 57.9 | — | — | — | — | |
| OPSD+ViCuRModel Scale=2B2026.06 | 57.8 | — | — | — | — | |
| OPDModel Scale=2B2026.06 | 57.6 | — | — | — | — | |
| Qwen3-OmniReasoning=true, Model Size=30B, Zero-shot=true2026.04 | 57.5 | — | — | — | — | |
| Video-R1-7BFrames=162026.07 | 57.4 | — | — | — | — | |
| Kangaroo-8BFrames=-2026.07 | 56 | — | — | — | — | |
| Qwen2.5 OmniReasoning=false, Model Size=3B, Zero-shot=true2026.04 | 55.4 | — | — | — | — | |
| DBTrimKVBudget=10242026.05 | 54.93 | — | — | — | — | |
| DBTrimKVBudget=1282026.05 | 54.85 | — | — | — | — | |
| TrimKVBudget=5122026.05 | 54.74 | — | — | — | — | |
| DBTrimKVBudget=5122026.05 | 54.41 | — | — | — | — | |
| VanillaBudget=Full2026.05 | 54.22 | — | — | — | — | |
| TrimKVBudget=10242026.05 | 54.15 | — | — | — | — | |
| DBTrimKVBudget=2562026.05 | 54.15 | — | — | — | — | |
| DBTrimKVBudget=642026.05 | 54.15 | — | — | — | — | |
| Ada-Pyramid-KVBudget=10242026.05 | 53.81 | — | — | — | — | |
| AdaKVBudget=5122026.05 | 53.77 | — | — | — | — | |
| TrimKVBudget=2562026.05 | 53.15 | — | — | — | — | |
| Ada-Pyramid-KVBudget=5122026.05 | 52.63 | — | — | — | — | |
| LongVA-7BFrames=-2026.07 | 52.6 | — | — | — | — | |
| Video-UTR-7BFrames=-2026.07 | 52.6 | — | — | — | — | |
| TrimKVBudget=1282026.05 | 52.55 | — | — | — | — | |
| AdaKVBudget=2562026.05 | 52.15 | — | — | — | — | |
| AdaKVBudget=10242026.05 | 52 | — | — | — | — | |
| R-KVBudget=10242026.05 | 51.48 | — | — | — | — | |
| R-KVBudget=2562026.05 | 51.26 | — | — | — | — | |
| Qwen3.5-9BCoTFrames=162026.07 | 51 | — | — | — | — | |
| Ada-Pyramid-KVBudget=2562026.05 | 50.52 | — | — | — | — | |
| Qwen3.5-9BCoTFrames=322026.07 | 50.3 | — | — | — | — | |
| SnapKVBudget=2562026.05 | 50.15 | — | — | — | — | |
| TrimKVBudget=642026.05 | 49.74 | — | — | — | — | |
| R-KVBudget=5122026.05 | 49.51 | — | — | — | — | |
| SnapKVBudget=10242026.05 | 49.22 | — | — | — | — | |
| SnapKVBudget=5122026.05 | 49.22 | — | — | — | — | |
| Qwen3.5-9BCoTFrames=642026.07 | 48.5 | — | — | — | — | |
| VideoLLaMA2Frames=-2026.07 | 47.9 | — | — | — | — | |
| AdaKVBudget=1282026.05 | 47.44 | — | — | — | — | |
| R-KVBudget=1282026.05 | 46.56 | — | — | — | — | |
| SnapKVBudget=1282026.05 | 46.15 | — | — | — | — | |
| Ada-Pyramid-KVBudget=1282026.05 | 45.78 | — | — | — | — | |
| AF3 (think)Reasoning=true, Model Size=Teacher, Zero-shot=true2026.04 | 45 | — | — | — | — | |
| v-SALMONN-o1Reasoning=true, Model Size=7B, Zero-shot=true2026.04 | 41.3 | — | — | — | — | |
| DyCokeModel=LLaVA-OneVision-7B, Retention Ratio=50%2026.01 | — | 71.6 | 56 | 49.7 | 59.1 | |
| DyCokeModel=LLaVA-Video-7B, Retention Ratio=50%2026.01 | — | 70.8 | 54.1 | 49.8 | 58.1 | |
| DyCokeModel=Qwen2-VL-7B, Retention Ratio=50%2026.01 | — | 67.9 | 53.7 | 49 | 56.9 | |
| FastVModel=LLaVA-OneVision-7B, Retention Ratio=50%2026.01 | — | 71.8 | 57.6 | 47.8 | 59 | |
| FastVModel=LLaVA-Video-7B, Retention Ratio=50%2026.01 | — | 70.2 | 54.7 | 51.5 | 58.7 | |
| FastVModel=Qwen2-VL-7B, Retention Ratio=50%2026.01 | — | 66.9 | 53.7 | 49 | 56.6 | |
| Gemini-1.5-Pro2026.06 | — | — | — | — | 71.2 | |
| Gemini-2.5-Pro2026.06 | — | — | — | — | 78.4 | |
| GPT-4o2025.10 | — | — | — | — | 71.9 | |
| GPT-4o2026.06 | — | — | — | — | 75.4 | |
| GPT-52026.06 | — | — | — | — | 82.6 | |
| HumanOmniV2Inference Mode=w/ Audio2026.04 | — | — | — | — | 65.6 | |
| HumanOmniV2Inference Mode=w/o Audio2026.04 | — | — | — | — | 61.2 | |
| KangarooSize=8B, #Frames=642026.06 | — | — | — | — | 56 | |
| LLaVA-OneV-7B2025.10 | — | — | — | — | 58.2 | |
| LLaVA-OneVisionSize=7B, #Frames=642026.06 | — | — | — | — | 58.2 | |
| LongVASize=7B, #Frames=1282026.06 | — | — | — | — | 52.6 | |
| LongVA-7B2025.10 | — | — | — | — | 52.6 | |
| Omni-R1Inference Mode=w/ Audio2026.04 | — | — | — | — | 63.2 | |
| Omni-R1Inference Mode=w/o Audio2026.04 | — | — | — | — | 60.3 | |
| OmniJigsaw (CMM)Inference Mode=w/ Audio2026.04 | — | — | — | — | 73.1 | |
| OmniJigsaw (CMM)Inference Mode=w/o Audio2026.04 | — | — | — | — | 69.3 | |
| OmniJigsaw (JMI)Inference Mode=w/ Audio2026.04 | — | — | — | — | 72.9 | |
| OmniJigsaw (JMI)Inference Mode=w/o Audio2026.04 | — | — | — | — | 68.8 | |
| OmniJigsaw (SMS)Inference Mode=w/ Audio2026.04 | — | — | — | — | 72.9 | |
| OmniJigsaw (SMS)Inference Mode=w/o Audio2026.04 | — | — | — | — | 69 | |
| OursSize=7B, #Frames=322026.06 | — | — | — | — | 59.6 |