Mathematical Reasoning on AIME 25 (Pass@1, Avg. Pass@1)
13.1Pass@1PACED-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PACED-RLModel=Qwen2.5-Math-7B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 13.1 | 40.1 | |
| MoPPSModel=Qwen2.5-Math-7B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 12.9 | 38.6 | |
| DSModel=Qwen2.5-Math-7B, Avg. Rollouts=2.5x, Avg@32=true2026.02 | 12 | 39.4 | |
| LILOModel=Qwen2.5-Math-7B, Avg. Rollouts=4.0x, Avg@32=true2026.02 | 11.7 | 40.1 | |
| GRPOModel=Qwen2.5-Math-7B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 10.3 | 37.2 | |
| FlowRLModel=Qwen2.5-Math-7B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 9.4 | 36.5 | |
| PACED-RLModel=Qwen2.5-Math-1.5B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 7.3 | 32.1 | |
| LILOModel=Qwen2.5-Math-1.5B, Avg. Rollouts=4.0x, Avg@32=true2026.02 | 6.9 | 31.2 | |
| MoPPSModel=Qwen2.5-Math-1.5B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 6.6 | 30.4 | |
| DSModel=Qwen2.5-Math-1.5B, Avg. Rollouts=2.0x, Avg@32=true2026.02 | 6.5 | 31.2 | |
| GRPOModel=Qwen2.5-Math-1.5B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 6.3 | 29.1 | |
| FlowRLModel=Qwen2.5-Math-1.5B, Avg. Rollouts=1.0x, Avg@32=true2026.02 | 5.9 | 27.1 |