Mathematical Reasoning on AMC23 (Average@16 and Avg.)
91.09Average@16Teacher
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TeacherBackbone=QwQ-32B, Prompting=zero-shot2026.04 | 91.09 | 73.9 | |
| IRDSModel=QWEN3-4B, Data Budget=30%2026.05 | 82.4 | — | |
| IRDSModel=QWEN3-4B, Data Budget=10%2026.05 | 76.8 | — | |
| PPL-TOPModel=QWEN3-4B, Data Budget=30%2026.05 | 74.6 | — | |
| DEPOModel=QWEN3-4B, Data Budget=30%2026.05 | 71.4 | — | |
| LIMRModel=QWEN3-4B, Data Budget=30%2026.05 | 71.4 | — | |
| DenoiseRL-DAPOBase Model=Qwen3-8B-Base2026.05 | 71.4 | — | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=30%2026.05 | 70.6 | — | |
| DenoiseRL-GRPOBase Model=Qwen3-8B-Base2026.05 | 70.3 | — | |
| IFDModel=QWEN3-4B, Data Budget=30%2026.05 | 70.2 | — | |
| GRPOBase Model=Qwen3-8B-Base2026.05 | 69.7 | — | |
| DAPOBase Model=Qwen3-8B-Base2026.05 | 69.7 | — | |
| RANDOMModel=QWEN3-4B, Data Budget=30%2026.05 | 64.9 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-7B, Training Method=CurES-GRPO2025.10 | 64.38 | 52.41 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-7B, Training Method=GVM-GRPO2025.10 | 64.31 | 50.64 | |
| DenoiseRL-DAPOBase Model=Qwen3-4B-Base2026.05 | 63.6 | — | |
| GRPOBase Model=Qwen3-4B-Base2026.05 | 63.1 | — | |
| +RPPBase Model=Qwen2.5-Math-7B, Training Method=RPP2025.10 | 62.81 | 50.18 | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-RPP2025.10 | 62.81 | 49.56 | |
| DAPOBase Model=Qwen3-4B-Base2026.05 | 62.5 | — | |
| DenoiseRL-GRPOBase Model=Qwen3-4B-Base2026.05 | 61.4 | — | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-7B, Training Method=Speed-RL-GRPO2025.10 | 60.16 | 48.84 | |
| +CurES-RPPBase Model=Qwen2.5-Math-7B, Training Method=CurES-RPP2025.10 | 58.75 | 49.62 | |
| +GRPOBase Model=Qwen2.5-Math-7B, Training Method=GRPO2025.10 | 57.5 | 47.59 | |
| IRDSModel=QWEN3-1.7B, Data Budget=30%2026.05 | 57.5 | — | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=30%2026.05 | 57.4 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-7B, Training Method=GVM-RPP2025.10 | 53.44 | 46.95 | |
| IRDSModel=QWEN3-1.7B, Data Budget=10%2026.05 | 52.9 | — | |
| +CurES-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-GRPO2025.10 | 52.19 | 44.94 | |
| RANDOMModel=QWEN3-1.7B, Data Budget=30%2026.05 | 51.2 | — | |
| +GVM-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-RPP2025.10 | 50.94 | 42.21 | |
| +CurES-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=CurES-RPP2025.10 | 50.94 | 44.14 | |
| +GVM-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GVM-GRPO2025.10 | 50.47 | 42.82 | |
| DEPOModel=QWEN3-1.7B, Data Budget=30%2026.05 | 50.2 | — | |
| BaseBase Model=Qwen3-8B-Base2026.05 | 49.2 | — | |
| +Speed-RL-RPPBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-RPP2025.10 | 47.34 | 41.75 | |
| +Speed-RL-GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=Speed-RL-GRPO2025.10 | 47.19 | 41.34 | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=30%2026.05 | 46.9 | — | |
| LIMRModel=QWEN3-1.7B, Data Budget=30%2026.05 | 46.4 | — | |
| +GRPOBase Model=Qwen2.5-Math-1.5B, Training Method=GRPO2025.10 | 45.47 | 41.64 | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=30%2026.05 | 44 | — | |
| IFDModel=QWEN3-1.7B, Data Budget=30%2026.05 | 43.4 | — | |
| BaseBase Model=Qwen3-4B-Base2026.05 | 43.1 | — | |
| Gen-SSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot, Chunk size=4K2026.04 | 41.88 | 34.94 | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=30%2026.05 | 39.2 | — | |
| +RPPBase Model=Qwen2.5-Math-1.5B, Training Method=RPP2025.10 | 39.06 | 35.86 | |
| MoRSDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 38.75 | 33.07 | |
| MCC-KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 35.47 | 30.25 | |
| Standard KDBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 35 | 29.01 | |
| Self-DistillationBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 29.53 | 24.25 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Method=Base2025.10 | 27.19 | 33.48 | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 23.8 | — | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 23.8 | — | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 23.2 | — | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 23 | — | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 22.9 | — | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 22.3 | — | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=10%2026.05 | 21 | — | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 20.6 | — | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=30%2026.05 | 20.2 | — | |
| Cold StartBackbone=Qwen2.5-Math-1.5B, Prompting=zero-shot2026.04 | 19.53 | 18.3 | |
| StudentBackbone=Qwen2.5-Math-1.5B, Prompting=two-shot2026.04 | 19.06 | 15.54 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Method=Base2025.10 | 14.84 | 20 |