Mathematical Reasoning on GSM8K (Mean@8 Accuracy)
81.79Mean@8 AccuracyAsymPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AsymPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 81.79 | |
| GRPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 81.77 | |
| SPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 81.71 |