Mathematical Reasoning on AIME 25 (Pass@8)
16.67Pass@8GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 16.67 | |
| SPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 16.67 | |
| AsymPOBase Model=Qwen3-1.7B-Base, Training Data=randomly sampled 4k subset of DAPO-17K, Evaluation Rollouts=82026.06 | 13.33 |