General Multimodal Reasoning on NaturalBench
78.62General ScoreQwen2.5-VL-7B + SRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + SRPOBackbone=Qwen2.5-VL-7B2026.05 | 78.62 | |
| VL-Rethinker-7BBackbone=Qwen2.5-VL-7B2026.05 | 78.17 | |
| PAPO-D-7BBackbone=Qwen2.5-VL-7B2026.05 | 78.11 | |
| ThinkLite-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 78.09 | |
| Qwen2.5-VL-7B + DAPOBackbone=Qwen2.5-VL-7B2026.05 | 78.05 | |
| Vision-Matters-7BBackbone=Qwen2.5-VL-7B2026.05 | 78.01 | |
| Perception-R1-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.96 | |
| VPPO-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.94 | |
| PAPO-G-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.92 | |
| Qwen2.5-VL-7B + GRPOBackbone=Qwen2.5-VL-7B2026.05 | 77.92 | |
| PRCO-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.83 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.67 | |
| Vision-SR1-7BBackbone=Qwen2.5-VL-7B2026.05 | 77.65 | |
| Qwen2.5-VL-3B + SRPOBackbone=Qwen2.5-VL-3B2026.05 | 74.83 | |
| PAPO-G-3BBackbone=Qwen2.5-VL-3B2026.05 | 74.76 | |
| Qwen2.5-VL-3B + DAPOBackbone=Qwen2.5-VL-3B2026.05 | 74.61 | |
| PAPO-D-3BBackbone=Qwen2.5-VL-3B2026.05 | 74.45 | |
| PRCO-3BBackbone=Qwen2.5-VL-3B2026.05 | 74.31 | |
| Qwen2.5-VL-3B + GRPOBackbone=Qwen2.5-VL-3B2026.05 | 74.11 | |
| Vision-SR1-3BBackbone=Qwen2.5-VL-3B2026.05 | 73.83 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 72.27 |