Math Reasoning on MathVerse
80.1Avg@8 ScoreADHint
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADHintBase Model=Qwen3-VL-8B-Instruct2025.12 | 80.1 | 75.2 | |
| GRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 79 | 63.1 | |
| HintGRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 68.7 | 64.2 | |
| VA-OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 31.9 | — | |
| OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 29.1 | — | |
| PAPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 25.8 | — | |
| GRPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 24.9 | — | |
| Off-policy KDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 24.3 | — | |
| CoT-SFTTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 23.9 | — | |
| BaseTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 19.6 | — | |
| Auxiliary Reward2026.03 | — | 42.92 | |
| Ctrl-RPower scaling factor (β)=0.22026.03 | — | 42.72 | |
| GRPO2026.03 | — | 40.61 | |
| OpenVLThinker2026.03 | — | 41.42 | |
| Trajectory-Hint2026.03 | — | 43.22 |