Mathematical Reasoning Average
38.66Mean@8 AccuracyAsymPO
Evaluation Results
| Method | Links | |
|---|---|---|
| AsymPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 38.66 | |
| SPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 38.13 | |
| GRPOModel=Qwen3-1.7B-Base, Training Data=4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 37.18 |