Visual Mathematical Reasoning on MathVista 1.0 (testmini)
67.6AccuracyQwen2.5-VL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.03 | 67.6 | |
| Qwen2.5-VL-7B + SFT+GRPOBackbone=Qwen2.5-VL-7B, Stage=SFT+GRPO2026.03 | 66.5 | |
| Qwen2.5-VL-7B + SFTBackbone=Qwen2.5-VL-7B, Stage=SFT2026.03 | 66.3 | |
| Qwen2.5-VL-7B + SFT+DPOBackbone=Qwen2.5-VL-7B, Stage=SFT+DPO2026.03 | 65.5 | |
| Qwen2.5-VL-7B + SFT+DPO+GRPOBackbone=Qwen2.5-VL-7B, Stage=SFT+DPO+GRPO2026.03 | 65.2 | |
| Qwen2.5-VL-7B + SPA-VLBackbone=Qwen2.5-VL-7B, Alignment=SPA-VL2026.03 | 64 | |
| Qwen2.5-VL-7B + SaFeR-VLMBackbone=Qwen2.5-VL-7B, Alignment=SaFeR-VLM2026.03 | 63.9 | |
| Qwen2.5-VL-3B + SFTBackbone=Qwen2.5-VL-3B, Stage=SFT2026.03 | 55.3 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.03 | 54.3 | |
| Qwen2.5-VL-3B + SFT+DPOBackbone=Qwen2.5-VL-3B, Stage=SFT+DPO2026.03 | 54 | |
| Qwen2.5-VL-3B + VLGuardBackbone=Qwen2.5-VL-3B, Alignment=VLGuard2026.03 | 53.8 | |
| Qwen2.5-VL-3B + SPA-VLBackbone=Qwen2.5-VL-3B, Alignment=SPA-VL2026.03 | 53.3 | |
| Qwen2.5-VL-7B + TISBackbone=Qwen2.5-VL-7B, Alignment=TIS2026.03 | 53.2 | |
| Qwen2.5-VL-7B + VLGuardBackbone=Qwen2.5-VL-7B, Alignment=VLGuard2026.03 | 52.7 | |
| Qwen2.5-VL-3B + SaFeR-VLMBackbone=Qwen2.5-VL-3B, Alignment=SaFeR-VLM2026.03 | 52.6 | |
| Qwen2.5-VL-3B + SFT+GRPOBackbone=Qwen2.5-VL-3B, Stage=SFT+GRPO2026.03 | 52 | |
| Qwen2.5-VL-3B + SFT+DPO+GRPOBackbone=Qwen2.5-VL-3B, Stage=SFT+DPO+GRPO2026.03 | 51.9 | |
| Qwen2.5-VL-3B + TISBackbone=Qwen2.5-VL-3B, Alignment=TIS2026.03 | 45.6 |