Mathematical Reasoning on AIME 2025 (Mean@4, Pass@4)
21.56Mean@4Q3-4B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 21.56 | 29.66 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 20.83 | 27.78 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 19.16 | 27.69 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 16.87 | 26.16 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 15.41 | 22.23 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 10.41 | 19.12 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 6.8 | 13.36 |