Video Understanding and Reasoning on Video-MMMU (test)
0.612AccuracyGPT-4o
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4oFrames=-2026.04 | 0.612 | — | — | — | — | |
| VIDEOP2RBase Model=Qwen2.5-VL-7B2025.11 | 0.55 | — | — | — | — | |
| VideoChat-R1Base Model=Qwen2.5-VL-7B2025.11 | 0.54 | — | — | — | — | |
| Video-R1Frames=642026.04 | 0.524 | — | — | — | — | |
| Video-R1Base Model=Qwen2.5-VL-7B2025.11 | 0.523 | — | — | — | — | |
| Video-R1Frames=322026.04 | 0.523 | — | — | — | — | |
| VersaVid-R1Base Model=Qwen2.5-VL-7B2025.11 | 0.519 | — | — | — | — | |
| Video-ToCFrames=322026.04 | 0.513 | — | — | — | — | |
| VideoRFTBase Model=Qwen2.5-VL-7B2025.11 | 0.511 | — | — | — | — | |
| Time-R1Base Model=Qwen2.5-VL-7B2025.11 | 0.51 | — | — | — | — | |
| Video-ToCFrames=642026.04 | 0.51 | — | — | — | — | |
| Video-ToCFrames=162026.04 | 0.505 | — | — | — | — | |
| Baseline (Qwen2.5-VL-7B)Frames=642026.04 | 0.504 | — | — | — | — | |
| Video-R1Frames=162026.04 | 0.498 | — | — | — | — | |
| Video-R1-SFTFrames=322026.04 | 0.494 | — | — | — | — | |
| Video-R1-SFTFrames=642026.04 | 0.494 | — | — | — | — | |
| VideoChat-R1Frames=162026.04 | 0.487 | — | — | — | — | |
| Video-ToC-SFTFrames=642026.04 | 0.483 | — | — | — | — | |
| Qwen2.5-VL-7BModel Scale=7B2025.11 | 0.481 | — | — | — | — | |
| Baseline (Qwen2.5-VL-7B)Frames=322026.04 | 0.481 | — | — | — | — | |
| Baseline (Qwen2.5-VL-7B)Frames=162026.04 | 0.478 | — | — | — | — | |
| Video-R1-SFTFrames=162026.04 | 0.474 | — | — | — | — | |
| Video-ToC-SFTFrames=322026.04 | 0.471 | — | — | — | — | |
| Video-ToC-SFTFrames=162026.04 | 0.465 | — | — | — | — | |
| LLaVA-OneVision-7BModel Scale=7B2025.11 | 0.338 | — | — | — | — | |
| LLaVA-OneVision-7BFrames=-2026.04 | 0.338 | — | — | — | — | |
| LongVA-7BModel Scale=7B2025.11 | 0.239 | — | — | — | — | |
| LongVA-7BFrames=-2026.04 | 0.239 | — | — | — | — | |
| VILA-1.5-8BFrames=-2026.04 | 0.208 | — | — | — | — | |
| DINO-HEALBase Model=Qwen2.5-VL-7B2025.12 | — | 0.455 | 0.583 | 0.48 | 0.301 | |
| DINO-HEALBase Model=Video-R12025.12 | — | 0.463 | 0.62 | 0.463 | 0.307 | |
| DINO-HEALBase Model=LLaVA-NEXT-Video-7B2025.12 | — | 0.228 | 0.27 | 0.18 | 0.233 | |
| LLaVA-NEXT-Video-7BDecoding Method=Greedy2025.12 | — | 0.24 | 0.267 | 0.189 | 0.263 | |
| Qwen2.5-VL-7BDecoding Method=Greedy2025.12 | — | 0.457 | 0.56 | 0.5 | 0.31 | |
| SmartSightBase Model=Qwen2.5-VL-7B2025.12 | — | 0.476 | 0.597 | 0.513 | 0.317 | |
| SmartSightBase Model=Video-R12025.12 | — | 0.519 | 0.66 | 0.507 | 0.39 | |
| SmartSightBase Model=LLaVA-NEXT-Video-7B2025.12 | — | 0.251 | 0.271 | 0.22 | 0.263 | |
| TCDBase Model=Qwen2.5-VL-7B2025.12 | — | 0.447 | 0.547 | 0.477 | 0.316 | |
| TCDBase Model=Video-R12025.12 | — | 0.466 | 0.637 | 0.443 | 0.317 | |
| TCDBase Model=LLaVA-NEXT-Video-7B2025.12 | — | 0.238 | 0.273 | 0.167 | 0.273 | |
| VCDBase Model=Qwen2.5-VL-7B2025.12 | — | 0.455 | 0.593 | 0.465 | 0.305 | |
| VCDBase Model=Video-R12025.12 | — | 0.475 | 0.64 | 0.457 | 0.33 | |
| VCDBase Model=LLaVA-NEXT-Video-7B2025.12 | — | 0.244 | 0.237 | 0.203 | 0.293 | |
| Video-R1Decoding Method=Greedy2025.12 | — | 0.486 | 0.64 | 0.473 | 0.343 |