Multi-Discipline Reasoning on MMMU (pass@1, avg@8)
64.4pass@1ADHint
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ADHintBase Model=Qwen3-VL-8B-Instruct2025.12 | 64.4 | 70.1 | |
| GRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 61 | 71.7 | |
| ADHintBase MLLM=Qwen2.5-VL-7B2025.12 | 56.4 | 56.4 | |
| GRPOBase MLLM=Qwen2.5-VL-7B2025.12 | 55.3 | 55.6 | |
| GHPOBase MLLM=Qwen2.5-VL-7B2025.12 | 51.7 | 50 | |
| ADHintBase MLLM=Qwen2.5-VL-3B2025.12 | 51.4 | 50 | |
| GRPOBase MLLM=Qwen2.5-VL-3B2025.12 | 47.5 | 49.1 | |
| HintGRPOBase Model=Qwen3-VL-8B-Instruct2025.12 | 47.2 | 55.5 | |
| LUFFYBase MLLM=Qwen2.5-VL-7B2025.12 | 44.6 | 47.4 | |
| HintGRPOBase MLLM=Qwen2.5-VL-3B2025.12 | 44.4 | 43 | |
| GHPOBase MLLM=Qwen2.5-VL-3B2025.12 | 44.4 | 42.6 | |
| HintGRPOBase MLLM=Qwen2.5-VL-7B2025.12 | 40.6 | 39.3 | |
| SFT -> RLBase MLLM=Qwen2.5-VL-7B2025.12 | 35.9 | 54.2 | |
| LUFFYBase MLLM=Qwen2.5-VL-3B2025.12 | 34.3 | 44.6 | |
| SFTBase MLLM=Qwen2.5-VL-7B2025.12 | 31.2 | 51 | |
| SFT -> RLBase MLLM=Qwen2.5-VL-3B2025.12 | 30.6 | 47.7 | |
| SFTBase MLLM=Qwen2.5-VL-3B2025.12 | 28.6 | 46.3 | |
| StepHintBase MLLM=Qwen2.5-VL-7B2025.12 | 18.6 | 27.9 | |
| StepHintBase MLLM=Qwen2.5-VL-3B2025.12 | 18.3 | 35.7 |