Mathematical Reasoning on AMC 2023 (test) (Pass@1, Pass@32)
36.67Pass@1GRPO + LatentRevise
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO + LatentReviseModel=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 36.67 | 92.5 | |
| SFT + LatentReviseModel=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 34.86 | 90 | |
| GRPO(n=16)Model=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 33.67 | 85 | |
| GRPOModel=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 31.02 | 90 | |
| BaseModel=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 29.45 | 90 | |
| OPSDModel=Qwen3-8B-Base, Training Condition=DAPO-14k-Hard2026.06 | 26.17 | 87.5 | |
| GRPO(n=16)Model=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 25.08 | 85 | |
| SFT + LatentReviseModel=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 25 | 75 | |
| GRPO + LatentReviseModel=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 25 | 82.5 | |
| GRPOModel=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 22.89 | 75 | |
| BaseModel=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 22.34 | 72.5 | |
| OPSDModel=Qwen2.5-1.5B-Inst, Training Condition=DAPO-14k-Hard2026.06 | 9.84 | 67.5 |