Math Reasoning on MathVista (pass@1, avg@8)
79.6Avg Pass@8ADHint
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADHintBase Model=Qwen3-VL-8B-Instruct2025.12 | 79.6 | 74 | |
| GRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 78.8 | 74.6 | |
| ADHintBase MLLM=Qwen2.5-VL-7B2025.12 | 74.8 | 74.4 | |
| GRPOBase MLLM=Qwen2.5-VL-7B2025.12 | 73.4 | 73.4 | |
| SFT -> RLBase MLLM=Qwen2.5-VL-7B2025.12 | 71.1 | 64.7 | |
| SFTBase MLLM=Qwen2.5-VL-7B2025.12 | 68.7 | 59 | |
| VA-OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 66.4 | — | |
| Off-policy KDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 65.3 | — | |
| GRPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 64.6 | — | |
| PAPOTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 64.5 | — | |
| HintGRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 64.4 | 64.9 | |
| CoT-SFTTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 64.4 | — | |
| ADHintBase MLLM=Qwen2.5-VL-3B2025.12 | 64.3 | 64.8 | |
| HintGRPOBase MLLM=Qwen2.5-VL-7B2025.12 | 64.3 | 65.9 | |
| GHPOBase MLLM=Qwen2.5-VL-7B2025.12 | 63.9 | 66.1 | |
| BaseTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 63.9 | — | |
| OPDTeacher=Qwen3-VL-8B, Student=Qwen3-VL-2B, Training Data=Geometry3K, Temperature=1.0, Checkpoint Selection=Best checkpoint2026.05 | 63.7 | — | |
| SFT -> RLBase MLLM=Qwen2.5-VL-3B2025.12 | 63.3 | 53.6 | |
| GRPOBase MLLM=Qwen2.5-VL-3B2025.12 | 63.1 | 63.9 | |
| SFTBase MLLM=Qwen2.5-VL-3B2025.12 | 61.3 | 51.9 | |
| LUFFYBase MLLM=Qwen2.5-VL-7B2025.12 | 61.2 | 63.6 | |
| GHPOBase MLLM=Qwen2.5-VL-3B2025.12 | 55.2 | 57.3 | |
| HintGRPOBase MLLM=Qwen2.5-VL-3B2025.12 | 52.5 | 56.7 | |
| StepHintBase MLLM=Qwen2.5-VL-7B2025.12 | 49.5 | 47.2 | |
| LUFFYBase MLLM=Qwen2.5-VL-3B2025.12 | 45.6 | 41.2 | |
| StepHintBase MLLM=Qwen2.5-VL-3B2025.12 | 44.6 | 34.9 | |
| Auxiliary Reward2026.03 | — | 71.2 | |
| Ctrl-RPower scaling factor (β)=0.22026.03 | — | 70.9 | |
| GRPO2026.03 | — | 68.1 | |
| OpenVLThinker2026.03 | — | 71.2 | |
| Trajectory-Hint2026.03 | — | 69.8 |