Mathematical Reasoning on AIME 2026 (Mean@16, Pass@16)
77.7Mean@16Dense Rollout Dense Training
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Dense Rollout Dense TrainingModel Backbone=Qwen3-14B2026.06 | 77.7 | 86.46 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-14B, Sparsity Level=0.862026.06 | 77.08 | 85.58 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.922026.06 | 72.5 | 82.33 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-4B2026.06 | 72.29 | 82.16 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.862026.06 | 71.25 | 81.97 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-4B, Sparsity Level=0.922026.06 | 70.62 | 81.58 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-8B2026.06 | 69.79 | 81.76 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-8B, Sparsity Level=0.862026.06 | 69.79 | 81.25 | |
| Sparsity setup (0.92) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.922026.06 | 48.75 | 61.97 | |
| Dense Rollout Dense TrainingModel Backbone=Qwen3-1.7B2026.06 | 48.33 | 59.95 | |
| Sparsity setup (0.86) RolloutModel Backbone=Qwen3-1.7B, Sparsity Level=0.862026.06 | 46.45 | 59.14 | |
| Sparse with LoRA Distillation (DistillSparse)Model Backbone=Qwen3-1.7B2026.06 | 45.62 | 58.74 |