Mathematical Reasoning on AIME 25 (Avg@32)
36.35Avg@32OISD
Evaluation Results
| Method | Links | |
|---|---|---|
| OISDBackbone=Qwen3-4B2026.05 | 36.35 | |
| GRPOBackbone=Qwen3-4B2026.05 | 28.85 | |
| OPSDBackbone=Qwen3-4B2026.05 | 25.62 | |
| MHPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 21.6 | |
| MHPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 21.6 | |
| MHPOBackbone=Qwen2.5-7B-Instruct2026.03 | 16.7 | |
| STEERBackbone=Qwen2.5-Math-7B2025.10 | 16.1 | |
| DAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 15 | |
| DAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 15 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.10 | 14.3 | |
| GRPO w/ Fork TokensBackbone=Qwen2.5-Math-7B2025.10 | 14.3 | |
| GSPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 14.2 | |
| GSPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 14.2 | |
| SimpleRL-ZooBackbone=Qwen2.5-Math-7B2025.10 | 14.2 | |
| KL–CovBackbone=Qwen2.5-Math-7B2025.10 | 14.1 | |
| GRPO w/ Entro. LossBackbone=Qwen2.5-Math-7B2025.10 | 14 | |
| Entro. Adv.Backbone=Qwen2.5-Math-7B2025.10 | 13.5 | |
| OPOBackbone=Qwen2.5-Math-7B2025.10 | 13.4 | |
| SAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 13.1 | |
| SAPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 13.1 | |
| Eurus-PRIMEBackbone=Qwen2.5-Math-7B2025.10 | 13 | |
| Clip–CovBackbone=Qwen2.5-Math-7B2025.10 | 12.9 | |
| GRPO w/ clip-highBackbone=Qwen2.5-Math-7B2025.10 | 12.8 | |
| W-REINFORCEBackbone=Qwen2.5-Math-7B2025.10 | 12 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.03 | 11.4 | |
| GRPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 11 | |
| GRPOBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 11 | |
| GSPOBackbone=Qwen2.5-7B-Instruct2026.03 | 10.8 | |
| SAPOBackbone=Qwen2.5-7B-Instruct2026.03 | 10.1 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.03 | 8.6 | |
| BaselineBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 7.7 | |
| BaselineBackbone=Qwen2.5-Math-7B-Instruct2026.03 | 7.7 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2025.10 | 5.3 | |
| BaselineBackbone=Qwen2.5-7B-Instruct2026.03 | 3.5 | |
| Qwen3-30B-A3B-Instruct-2507Role=Teacher Model2026.06 | 0.628 | |
| IW-OPDStudent=Qwen3-4B2026.06 | 0.497 | |
| IW-OPDStudent=Qwen3-4B, Training Step=102026.06 | 0.493 | |
| OPDStudent=Qwen3-4B2026.06 | 0.48 | |
| OPDStudent=Qwen3-4B, Training Step=102026.06 | 0.424 | |
| IW-OPDStudent=Qwen3-1.7B2026.06 | 0.295 | |
| OPDStudent=Qwen3-1.7B2026.06 | 0.287 | |
| IW-OPDStudent=Qwen3-1.7B, Training Step=102026.06 | 0.232 | |
| BaseStudent=Qwen3-4B2026.06 | 0.214 | |
| OPDStudent=Qwen3-1.7B, Training Step=102026.06 | 0.202 | |
| IW-OPDStudent=Qwen3-0.6B2026.06 | 0.193 | |
| OPDStudent=Qwen3-0.6B2026.06 | 0.178 | |
| IW-OPDStudent=Qwen3-0.6B, Training Step=102026.06 | 0.158 | |
| OPDStudent=Qwen3-0.6B, Training Step=102026.06 | 0.141 | |
| BaseStudent=Qwen3-1.7B2026.06 | 0.11 | |
| BaseStudent=Qwen3-0.6B2026.06 | 0.034 |