Mathematical Reasoning on AIME 25 (Average@16, Avg.)
49.79Average@16 ScoreTeacher
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TeacherBackbone=QwQ-32B, Prompting=zero-shot2026.04 | 49.79 | 73.9 | |
| IRDSModel=QWEN3-4B, Data Budget=10%2026.05 | 26 | — | |
| IRDSModel=QWEN3-1.7B, Data Budget=10%2026.05 | 16.4 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 15.21 | 52.41 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 15 | 50.64 | |
| Dr.GRPOBackbone=Llama3.2-3B-Instruct, Domain Type=In-domain2026.05 | 13.1 | — | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 12.92 | 49.62 | |
| GRPOBackbone=Llama3.2-3B-Instruct, Domain Type=In-domain2026.05 | 12.5 | — | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 12.08 | 49.56 | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 11.67 | 50.18 | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 11.46 | 44.14 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 11.46 | 48.84 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 11.25 | 42.82 | |
| PRIMEBackbone=Llama3.2-3B-Instruct, Domain Type=In-domain2026.05 | 11.2 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 10.42 | 44.94 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 10.08 | 41.75 | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 10 | 47.59 | |
| Gen-SSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot, Chunk size=4K2026.04 | 10 | 34.94 | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 8.33 | 46.95 | |
| MoRSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 7.5 | 33.07 | |
| Standard KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 7.08 | 29.01 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 6.88 | 41.34 | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 6.67 | 41.64 | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 6.04 | 42.21 | |
| MCC-KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 5.21 | 30.25 | |
| Cold StartBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 3.75 | 18.3 | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 3.33 | 35.86 | |
| Self-DistillationBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 2.71 | 24.25 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 1.88 | 33.48 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 1.67 | 20 | |
| StudentBackbone=Qwen2.5-Math-1.5B, Prompting=two-shot2026.04 | 0.83 | 15.54 | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=10%2026.05 | 0.4 | — | |
| OriginalBackbone=Llama3.2-3B-Instruct, Domain Type=In-domain2026.05 | 0.3 | — |