Complex Reasoning on Video-TT
46.5AccuracyOmniJigsaw (CMM)
Evaluation Results
| Method | Links | |
|---|---|---|
| OmniJigsaw (CMM)Inference Mode=w/o Audio2026.04 | 46.5 | |
| OmniJigsaw (CMM)Inference Mode=w/ Audio2026.04 | 46.1 | |
| OmniJigsaw (SMS)Inference Mode=w/o Audio2026.04 | 45.9 | |
| OmniJigsaw (SMS)Inference Mode=w/ Audio2026.04 | 45.8 | |
| VideoJigsawInference Mode=w/ Audio2026.04 | 44.9 | |
| VideoJigsawInference Mode=w/o Audio2026.04 | 44.9 | |
| OmniJigsaw (JMI)Inference Mode=w/o Audio2026.04 | 44.8 | |
| OmniJigsaw (JMI)Inference Mode=w/ Audio2026.04 | 44.7 | |
| VideoLatent-7B (Ours)Frames=32, Architecture Category=Latent MLLM2026.06 | 44.4 | |
| Qwen3-Omni-30BInference Mode=w/ Audio2026.04 | 44.3 | |
| VideoLatent-7B (Ours)Frames=64, Architecture Category=Latent MLLM2026.06 | 43.9 | |
| Qwen3-Omni-30BInference Mode=w/o Audio2026.04 | 43.8 | |
| VideoLatent-7B (Ours)Frames=16, Architecture Category=Latent MLLM2026.06 | 43.4 | |
| Video-R1-7BFrames=32, Architecture Category=Standard MLLM2026.06 | 41.8 | |
| Video-R1-7BFrames=64, Architecture Category=Standard MLLM2026.06 | 41.8 | |
| Qwen3-VL-8B + SynRLParameters=8B, Training=SynRL2026.03 | 41.5 | |
| Mull-Token-7BFrames=16, Architecture Category=Latent MLLM2026.06 | 41.3 | |
| Mull-Token-7BFrames=64, Architecture Category=Latent MLLM2026.06 | 41.1 | |
| Video-R1-7BFrames=16, Architecture Category=Standard MLLM2026.06 | 40.8 | |
| Mull-Token-7BFrames=32, Architecture Category=Latent MLLM2026.06 | 40.8 | |
| Qwen3-VL-4B + SynRLParameters=4B, Training=SynRL2026.03 | 40.7 | |
| Qwen3-VL-8BParameters=8B2026.03 | 40.6 | |
| Video-R1Inference Mode=w/o Audio2026.04 | 40.6 | |
| HumanOmniV2Inference Mode=w/ Audio2026.04 | 40.3 | |
| Open-o3-Video-7BFrames=64, Architecture Category=Standard MLLM2026.06 | 39.7 | |
| Open-o3-Video-7BFrames=32, Architecture Category=Standard MLLM2026.06 | 39.3 | |
| LVR-7BFrames=64, Architecture Category=Latent MLLM2026.06 | 39.3 | |
| Qwen3-VL-4BParameters=4B2026.03 | 38.9 | |
| Qwen2.5-VL-7BFrames=64, Architecture Category=Standard MLLM2026.06 | 38.7 | |
| LVR-7BFrames=32, Architecture Category=Latent MLLM2026.06 | 38.3 | |
| HumanOmniV2Inference Mode=w/o Audio2026.04 | 38.2 | |
| Qwen2.5-VL-7BFrames=32, Architecture Category=Standard MLLM2026.06 | 37.9 | |
| Omni-R1Inference Mode=w/o Audio2026.04 | 37 | |
| LVR-7BFrames=16, Architecture Category=Latent MLLM2026.06 | 37 | |
| Qwen2.5-VL-7BFrames=16, Architecture Category=Standard MLLM2026.06 | 36.9 | |
| Omni-R1Inference Mode=w/ Audio2026.04 | 36.8 | |
| Monet-7BFrames=64, Architecture Category=Latent MLLM2026.06 | 21.5 | |
| Monet-7BFrames=16, Architecture Category=Latent MLLM2026.06 | 20.6 | |
| Monet-7BFrames=32, Architecture Category=Latent MLLM2026.06 | 20.5 |