Mathematical Reasoning on MATH-500 (Mean@4)
82.65Mean@4Jackpot
Evaluation Results
| Method | Links | |
|---|---|---|
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 82.65 | |
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 80.82 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 80.52 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 79.5 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 76.45 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 73.65 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 65.9 | |
| Qwen2.5-3BTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K), Configuration=On-policy2026.02 | 63.9 | |
| JackpotTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 62.75 | |
| TIS + Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 60.45 | |
| Only Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 45.35 |