Mathematical Reasoning on AIME 2024 (Pass@1 Accuracy and Training Efficiency)
45.2Pass@1 AccuracyPRUNE-OPD (overlap)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PRUNE-OPD (overlap)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 45.2 | 4.1 | 40.6 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 44 | 4.3 | 37.7 | |
| OPDStudent-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 43.5 | 6.9 | 0 | |
| OPD (Truncate 4k)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / JustRL-DeepSeek-1.5B2026.05 | 43.1 | 4.8 | 30.4 | |
| OPDStudent-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 33.5 | 12.5 | 0 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 33.3 | 4 | 68 | |
| OPD (Truncate 4k)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 31.7 | 6.6 | 47.2 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=DeepSeek-R1-Distill-Qwen-1.5B / DeepSeek-R1-Distill-Qwen-7B2026.05 | 29.6 | 4.8 | 61.6 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 16.3 | 13.5 | 52.6 | |
| OPD (Truncate 4k)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 15.2 | 22.3 | 21.8 | |
| OPDStudent-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 14.8 | 28.5 | 0 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=Qwen3-4B-Base / Qwen3-4B (Non-thinking)2026.05 | 13.1 | 20 | 29.8 | |
| OPDStudent-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 7.3 | 16.5 | 0 | |
| PRUNE-OPD (overlap)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 7.3 | 10.3 | 37.6 | |
| OPD (Truncate 4k)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 6.3 | 12.9 | 21.8 | |
| PRUNE-OPD (top-p)Student-Teacher Pair=Qwen3-1.7B-Base / Qwen3-4B (Non-thinking)2026.05 | 5.6 | 11.5 | 30.3 |