Mathematical Reasoning on GSM8K (ACC, Pass@8)
92.4AccuracyGRPO + SALT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 92.4 | 99.3 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 92.1 | 99.2 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 91.9 | 98.7 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 91.7 | 99 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 90.4 | 97.8 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 90.4 | 97.6 | |
| VanillaBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=None (Base Model)2026.06 | 90.3 | 97.4 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 90.1 | 97.5 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 89.9 | 97.7 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 84.1 | 96.8 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 83.4 | 96.5 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 83 | 96.5 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 82.5 | 97.1 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 82.2 | 95.3 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 82.2 | 95 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 81 | 96.1 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 80.7 | 94.8 | |
| VanillaBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=None (Base Model)2026.06 | 80.3 | 95 |