Mathematical Reasoning on AMC 2022/2023
0.6204Mean@4 AccuracyJackpot
Evaluation Results
| Method | Links | |
|---|---|---|
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 0.6204 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 0.6114 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 0.5949 | |
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 0.5813 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 0.5662 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 0.4639 | |
| JackpotTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 0.3855 | |
| Qwen2.5-3BTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K), Configuration=On-policy2026.02 | 0.3765 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 0.3524 | |
| TIS + Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 0.3253 | |
| Only Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 0.2093 |