Mathematical Reasoning on AIME 2025 (Pass@1 Accuracy, Training Time, Training Time Reduction)
33.5Pass@1 AccuracyPRUNE-OPD (overlap)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PRUNE-OPD (overlap)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 33.5 | 4.1 | 40.6 | |
| OPDStudent-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 32.7 | 6.9 | 0 | |
| OPD (Truncate 4k)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 31 | 4.8 | 30.4 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 30.8 | 4.3 | 37.7 | |
| OPD (Truncate 4k)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 25.8 | 6.6 | 47.2 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 25.8 | 4 | 68 | |
| OPDStudent-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 25.4 | 12.5 | 0 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 24.2 | 4.8 | 61.6 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 14.6 | 13.5 | 52.6 | |
| OPD (Truncate 4k)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 13.5 | 22.3 | 21.8 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 12.7 | 20 | 29.8 | |
| OPDStudent-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 10.6 | 28.5 | 0 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 4.2 | 10.3 | 37.6 | |
| OPDStudent-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 2.9 | 16.5 | 0 | |
| OPD (Truncate 4k)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 2.9 | 12.9 | 21.8 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 2.9 | 11.5 | 30.3 |