Mathematical Reasoning on HMMT25 (Avg@32)
17.9Avg@32MHPO
Evaluation Results
| Method | Links | |
|---|---|---|
| MHPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 17.9 | |
| MHPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 17.9 | |
| MHPOBackbone=Qwen2.5-7B-Instruct2026.03 | 13.8 | |
| DAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 11.5 | |
| DAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 11.5 | |
| GSPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 10.9 | |
| GSPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 10.9 | |
| SAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 10 | |
| SAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 10 | |
| GRPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 9.6 | |
| GRPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 9.6 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.03 | 9.1 | |
| GSPOBackbone=Qwen2.5-7B-Instruct2026.03 | 8.5 | |
| SAPOBackbone=Qwen2.5-7B-Instruct2026.03 | 8 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.03 | 7.8 | |
| BaselineBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 7.5 | |
| BaselineBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 7.5 | |
| BaselineBackbone=Qwen2.5-7B-Instruct2026.03 | 5.6 | |
| Qwen3-30B-A3B-Instruct-2507Role=Teacher Model2026.06 | 0.442 | |
| IW-OPDStudent=Qwen3-4B2026.06 | 0.287 | |
| IW-OPDStudent=Qwen3-4B, Training Step=102026.06 | 0.273 | |
| OPDStudent=Qwen3-4B2026.06 | 0.271 | |
| OPDStudent=Qwen3-4B, Training Step=102026.06 | 0.235 | |
| IW-OPDStudent=Qwen3-1.7B2026.06 | 0.164 | |
| IW-OPDStudent=Qwen3-1.7B, Training Step=102026.06 | 0.156 | |
| OPDStudent=Qwen3-1.7B2026.06 | 0.155 | |
| OPDStudent=Qwen3-1.7B, Training Step=102026.06 | 0.144 | |
| BaseStudent=Qwen3-4B2026.06 | 0.1 | |
| IW-OPDStudent=Qwen3-0.6B2026.06 | 0.08 | |
| IW-OPDStudent=Qwen3-0.6B, Training Step=102026.06 | 0.076 | |
| OPDStudent=Qwen3-0.6B2026.06 | 0.071 | |
| BaseStudent=Qwen3-1.7B2026.06 | 0.068 | |
| OPDStudent=Qwen3-0.6B, Training Step=102026.06 | 0.065 | |
| BaseStudent=Qwen3-0.6B2026.06 | 0.013 |