Mathematical Reasoning on AIME 24 (ACC, Pass@8)
65.4AccuracyGRPO + SALT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 65.4 | 81.2 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 64.7 | 80.4 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 61.5 | 78 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 60.7 | 77.3 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 57.3 | 82.2 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 56.6 | 81.6 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 54.8 | 80 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 54 | 79.3 | |
| VanillaBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=None (Base Model)2026.06 | 50.7 | 78 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 32.9 | 63.8 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 32.7 | 62.8 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 32.1 | 62.9 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 31.1 | 59.9 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 30.6 | 60.6 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 29.3 | 59.3 | |
| VanillaBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=None (Base Model)2026.06 | 29.1 | 59.3 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 29.1 | 59 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 29 | 61.3 |