Multimodal Mathematical Reasoning on MATH-Vision
51.2AccuracyVision-R1 (7B)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Vision-R1 (7B)Backbone=7B2025.08 | 51.2 | 44.5 | |
| Visionary-R1 (3B)Backbone=3B2025.08 | 40.4 | 33.9 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-3B, Inference Protocol=Zero-shot (before RL)2025.08 | 40.4 | 35.5 | |
| Vision-SR1Backbone=Qwen2.5-VL-7B2025.08 | 36.2 | 52.2 | |
| Percention-R1 (7B)Backbone=7B2025.08 | 35.7 | 45.2 | |
| Vision-R1Backbone=Qwen2.5-VL-7B, Training Data=47K data2025.08 | 33.8 | 50.7 | |
| Zero-shot InferenceBackbone=Qwen2.5-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 31.9 | 41.5 | |
| Vision-R1Backbone=Qwen2.5-VL-3B, Training Data=47K data2025.08 | 29.9 | 47.1 | |
| Vision-SR1Backbone=Mimo-VL-7B2025.08 | 29.6 | 49.5 | |
| Vision-SR1Backbone=Qwen2.5-VL-3B2025.08 | 29.3 | 48.8 | |
| Vision-R1Backbone=Mimo-VL-7B, Training Data=47K data2025.08 | 25.7 | 46 | |
| Zero-shot InferenceBackbone=Mimo-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 21.6 | 44.4 |