Multi-modal Video Understanding on MMVU
67ScoreQwen3-VL-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=concise reason2025.12 | 67 | |
| Qwen3-VL-8BTraining Stages=PT, Decoding Mode=direct answer2025.12 | 66.4 | |
| Our Final ModelTraining Stages=PT, RL, Decoding Mode=concise reason2025.12 | 63.6 | |
| Qwen2.5-VL-7BTraining Stages=PT, Decoding Mode=direct answer2025.12 | 63.4 | |
| Video-R1-7BTraining Stages=PT, SFT, RL, Decoding Mode=chain-of-thought2025.12 | 62.4 | |
| Qwen2.5-VL-7BTraining Stages=PT, Decoding Mode=concise reason2025.12 | 55.2 |