Multimodal Reasoning on R1-Onevision-Bench (Overall)
39.2AccuracyMSSR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MSSRModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 39.2 | — | — | |
| MM-Eureka-Qwen-7BTraining Protocol=Zero RL2025.12 | 39.1 | — | — | |
| RLOOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 38.5 | — | — | |
| VLAA-Thinker-7BTraining Protocol=SFT + RL2025.12 | 38.4 | — | — | |
| GRPOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 37.7 | — | — | |
| ThinkLite-VL-7BTraining Protocol=Zero RL2025.12 | 35.7 | — | — | |
| R1-Onevision-7BTraining Protocol=SFT + RL2025.12 | 35.2 | — | — | |
| OpenVLThinker-7BTraining Protocol=SFT + RL2025.12 | 34.7 | — | — | |
| Qwen2.5-VL-7BTraining Protocol=Zero RL2025.12 | 34.6 | — | — | |
| Prune-on-LogicBase Model=Qwen3-VL2026.02 | 34.1 | 442.6 | 13 | |
| REINFORCE++Model=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 34 | — | — | |
| No CompressionBase Model=Qwen3-VL2026.02 | 33.8 | 621.2 | 18.4 | |
| XMCCBase Model=Qwen3-VL2026.02 | 33.3 | 112.9 | 3.4 | |
| StepEntropyBase Model=Qwen3-VL2026.02 | 32 | 384.9 | 12 | |
| GRPOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 30.2 | — | — | |
| No CompressionBase Model=Qwen2.5-VL2026.02 | 29.1 | 656.2 | 22.5 | |
| MSSRModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 29 | — | — | |
| XMCCBase Model=Qwen2.5-VL2026.02 | 28.9 | 111.3 | 3.9 | |
| RLOOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 28.8 | — | — | |
| Prune-on-LogicBase Model=Qwen2.5-VL2026.02 | 28.7 | 446.9 | 15.6 | |
| StepEntropyBase Model=Qwen2.5-VL2026.02 | 28 | 380 | 13.6 | |
| Qwen2.5-VL-3BTraining Protocol=Zero RL2025.12 | 27.6 | — | — | |
| REINFORCE++Model=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 21.7 | — | — |