Mathematical Reasoning on GSM8K (Accuracy, Mean Response Tokens, Length Reduction)
76.96AccuracyGRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GRPOModel=Qwen2.5-1.5B-Instruct, Rollout Group Size (G)=32, Training Time (s)=23519 ± 4033, Speedup (times)=1.002026.05 | 76.96 | 265.08 | — | |
| GRPO+FIRSTNModel=Qwen2.5-1.5B-Instruct, Rollout Group Size (G)=32, Training Time (s)=20205 ± 860, Speedup (times)=1.16 ± 0.182026.05 | 76.85 | 237.77 | 10.3 | |
| PairModel=Qwen2.5-1.5B-Instruct, Rollout Group Size (G)=32, Training Time (s)=3196 ± 256, Speedup (times)=7.36 ± 0.592026.05 | 74.44 | 144.77 | 45.4 | |
| BPPOModel=Qwen2.5-1.5B-Instruct, Rollout Group Size (G)=32, Training Time (s)=2672 ± 51, Speedup (times)=8.80 ± 0.172026.05 | 73.84 | 122.39 | 53.8 | |
| CPPOModel=Qwen2.5-1.5B-Instruct, Rollout Group Size (G)=32, Training Time (s)=3587 ± 552, Speedup (times)=6.56 ± 1.012026.05 | 73.64 | 232.62 | 12.2 |