Mathematical Reasoning on MATH 500 (ACC, Pass@8)
96.4AccuracyGRPO + SALT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 96.4 | 99.2 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 95.4 | 99.3 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 95.2 | 98.9 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 95.2 | 99.1 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 95 | 99.1 | |
| VanillaBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=None (Base Model)2026.06 | 94.9 | 98.8 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 94.9 | 99 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 94.4 | 99.1 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 94.2 | 99 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 88 | 97.3 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 88 | 98 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 87.2 | 98.4 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 87.1 | 97 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 86.1 | 97 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 85.9 | 96.8 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 85.6 | 96.7 | |
| VanillaBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=None (Base Model)2026.06 | 85.5 | 96.4 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 84.8 | 96.8 |