Mathematical Reasoning on AMC12
93.97Mean@4Sparsity setup (0.86) Rollout
Evaluation Results
| Method | Links | |
|---|---|---|
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.862026.06 | 93.97 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-14B2026.06 | 93.96 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-4B2026.06 | 93.67 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-14B, Sparsity Level=0.862026.06 | 93.67 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.922026.06 | 93.37 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-8B2026.06 | 93.37 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.922026.06 | 92.7 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.862026.06 | 92.16 | |
| Sparse with LoRA Distillation (DistillSparse)Model Backbone=Qwen3-1.7B2026.06 | 80.72 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-1.7B2026.06 | 73.33 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.922026.06 | 72.22 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.862026.06 | 71.66 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 54.44 | |
| JackpotTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 53.88 | |
| Q3-8BTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR), Configuration=On-policy2026.02 | 53.33 | |
| Q3-4BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 51.66 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-8B (15k, 64, DeepScaleR)2026.02 | 37.22 | |
| TIS + Reverse KLTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR)2026.02 | 32.77 | |
| JackpotTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 27.78 | |
| Qwen2.5-3BTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K), Configuration=On-policy2026.02 | 26.11 | |
| Q3-1.7BTraining Scenario=Qwen3-1.7B -> Qwen3-4B (20k, 64, DeepScaleR), Configuration=On-policy2026.02 | 25 | |
| TIS + Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 24.44 | |
| Only Reverse KLTraining Scenario=Qwen2.5-1.5B -> Qwen2.5-3B (14k, 64, MATH-8K)2026.02 | 14.07 |