Multi-modal Reasoning on MathVista (Accuracy)
79.2AccuracyAutoNPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AutoNPO2026.04 | 79.2 | |
| RLEPtype=far future2026.04 | 78.5 | |
| ExGRPOtype=historical replay2026.04 | 77.3 | |
| NPOstage=early-stage only2026.04 | 76.6 | |
| NPOstage=early + late-stage2026.04 | 76.3 | |
| GRPOtype=pure on-policy2026.04 | 76.2 | |
| Qwen3-VL-8B-Instruct2026.04 | 73.8 | |
| LUFFYtype=external teacher2026.04 | 73.8 | |
| Self-Instruct + Solver FeedbackBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 70.3 | |
| CoT Cold-Start + Solver FeedbackBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 70.1 | |
| Self-InstructBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 69.8 | |
| Self-Instruct + CoT-Self-InstructBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 69.3 | |
| Self-Instruct + R-ZeroBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 69.3 | |
| CoT Cold-StartBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 69.1 | |
| Seed SetBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 69 | |
| Base ModelBackbone=Qwen2.5-VL-7B-Instruct2025.11 | 68.4 |