Video reasoning on MLVU (test)
62.75AccuracyOmniJigsaw (CMM)
Evaluation Results
| Method | Links | |
|---|---|---|
| OmniJigsaw (CMM)Inference Mode=w/o Audio2026.04 | 62.75 | |
| OmniJigsaw (CMM)Inference Mode=w/ Audio2026.04 | 62.35 | |
| OmniJigsaw (SMS)Inference Mode=w/ Audio2026.04 | 61.75 | |
| VideoJigsawInference Mode=w/o Audio2026.04 | 61.55 | |
| OmniJigsaw (SMS)Inference Mode=w/o Audio2026.04 | 60.76 | |
| VideoJigsawInference Mode=w/ Audio2026.04 | 60.16 | |
| OmniJigsaw (JMI)Inference Mode=w/o Audio2026.04 | 59.76 | |
| OmniJigsaw (JMI)Inference Mode=w/ Audio2026.04 | 58.76 | |
| Qwen3-Omni-30BInference Mode=w/o Audio2026.04 | 58.76 | |
| Qwen3-Omni-30BInference Mode=w/ Audio2026.04 | 57.97 | |
| Video-R1-7B + replayFrame Count=16-frame, Activation Replay=true2025.11 | 57.4 | |
| Video-R1-7BFrame Count=16-frame, Activation Replay=false2025.11 | 55.7 | |
| GPT-4oFrame Count=16-frame, Activation Replay=false2025.11 | 54.2 | |
| Omni-R1Inference Mode=w/ Audio2026.04 | 52.59 | |
| Video-R1Inference Mode=w/o Audio2026.04 | 52.39 | |
| Omni-R1Inference Mode=w/o Audio2026.04 | 51 | |
| HumanOmniV2Inference Mode=w/ Audio2026.04 | 49 | |
| Qwen2.5-VL-7BFrame Count=16-frame, Activation Replay=false2025.11 | 48.4 | |
| HumanOmniV2Inference Mode=w/o Audio2026.04 | 48.21 |