Mathematical Reasoning on GSM8K (Mean@4)
93.61Mean@4TIS + Reverse KL
Evaluation Results
| Method | Links | |
|---|---|---|
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 93.61 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 93.57 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 93.29 | |
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 92.56 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 92.15 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 91.21 | |
| Qwen2.5-3BTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K), Configuration=On-policy2026.02 | 85 | |
| JackpotTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 84.28 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 83.8 | |
| TIS + Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 82.5 | |
| Only Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 74.17 |