General Multimodal Reasoning on MMMU-Pro
38.09ScoreQwen2.5-VL-7B + SRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + SRPOBackbone=Qwen2.5-VL-7B2026.05 | 38.09 | |
| PRCO-7BBackbone=Qwen2.5-VL-7B2026.05 | 36.94 | |
| VPPO-7BBackbone=Qwen2.5-VL-7B2026.05 | 35.89 | |
| PAPO-G-7BBackbone=Qwen2.5-VL-7B2026.05 | 35.37 | |
| PAPO-D-7BBackbone=Qwen2.5-VL-7B2026.05 | 35.2 | |
| Qwen2.5-VL-7B + DAPOBackbone=Qwen2.5-VL-7B2026.05 | 35.2 | |
| Vision-Matters-7BBackbone=Qwen2.5-VL-7B2026.05 | 34.91 | |
| Perception-R1-7BBackbone=Qwen2.5-VL-7B2026.05 | 34.73 | |
| Vision-SR1-7BBackbone=Qwen2.5-VL-7B2026.05 | 34.33 | |
| VL-Rethinker-7BBackbone=Qwen2.5-VL-7B2026.05 | 33.35 | |
| Qwen2.5-VL-7B + GRPOBackbone=Qwen2.5-VL-7B2026.05 | 32.65 | |
| ThinkLite-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 31.33 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 30.73 | |
| Qwen2.5-VL-3B + SRPOBackbone=Qwen2.5-VL-3B2026.05 | 29.65 | |
| Vision-SR1-3BBackbone=Qwen2.5-VL-3B2026.05 | 28.61 | |
| Qwen2.5-VL-3B + DAPOBackbone=Qwen2.5-VL-3B2026.05 | 28.15 | |
| PAPO-D-3BBackbone=Qwen2.5-VL-3B2026.05 | 27.91 | |
| PRCO-3BBackbone=Qwen2.5-VL-3B2026.05 | 27.8 | |
| PAPO-G-3BBackbone=Qwen2.5-VL-3B2026.05 | 27.68 | |
| Qwen2.5-VL-3B + GRPOBackbone=Qwen2.5-VL-3B2026.05 | 27.45 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 26.06 |