Mathematical Reasoning on AIME 2024 (Mean@4 and Pass@4)
49.71Pass@4PPCV
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PPCVBackbone=Qwen3-32B2026.02 | 49.71 | — | |
| Phi-DecodingBackbone=Qwen3-32B2026.02 | 41.61 | — | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 36.57 | 25 | |
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 35.14 | 25 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 33.85 | 24.37 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 33.64 | 23.5 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 27.41 | 17.7 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 20.31 | 13.33 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 17.41 | 10 |