Scientific Question Answering on GPQA (Accuracy, Pass@8)
53.1Accuracy (ACC)DAPO + SALT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 53.1 | 88.7 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 52.2 | 88.1 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 51.3 | 89.2 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 51.2 | 87.9 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 49.2 | 84.1 | |
| VanillaBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=None (Base Model)2026.06 | 48.9 | 82.4 | |
| DAPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 48.9 | 83.7 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=DAPO-MATH2026.06 | 47.6 | 84.6 | |
| GRPOBackbone=Deepseek-Distill-Qwen-7B, Training Dataset=MATH-TRAIN2026.06 | 46.8 | 83.8 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 39.6 | 83.5 | |
| DAPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 38.5 | 82.9 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 38.4 | 85.5 | |
| GRPO + SALTBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 37.7 | 85 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 37 | 81.7 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 36.2 | 83.7 | |
| DAPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=DAPO-MATH2026.06 | 36 | 80.9 | |
| GRPOBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=MATH-TRAIN2026.06 | 35 | 82.2 | |
| VanillaBackbone=Deepseek-Distill-Qwen-1.5B, Training Dataset=None (Base Model)2026.06 | 34.5 | 82.4 |