Mathematical Reasoning on GSM8K (Pass@8)
95.15Pass@8AsymPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AsymPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 95.15 | |
| SPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 94.62 | |
| GRPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 94.47 |