Mathematical Reasoning on AIME 25 (ACC, Pass@8)
46.5ACCGRPO + SALT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 46.5 | 75.5 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 46.3 | 68.3 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 45.3 | 74.5 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 44.8 | 66.6 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 43 | 64 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 42.8 | 72.1 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 42 | 71.3 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 42 | 62.7 | |
| VanillaBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=None (Base Model)2026.06 | 36.7 | 64 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 28 | 47 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 27.8 | 47.8 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 27.1 | 47.2 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 26 | 45 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 25.6 | 43.3 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 25.6 | 46.3 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 23.9 | 44.3 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 23.6 | 44.2 | |
| VanillaBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=None (Base Model)2026.06 | 22 | 42.6 |