Efficiency Analysis on Mathematical Reasoning Benchmarks
0.32Forward Pass Time (s)PS-PPO (Optimized)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PS-PPO (Optimized)Backpropagation budget (B)=128, Rollouts per prompt (K)=8, Number of training epochs=32026.06 | 0.32 | 0.43 | 1.01 | 0.01 | 1.77 | |
| S-GRPORollouts per prompt (K)=8, Number of training epochs=32026.06 | 0.82 | — | 1.81 | 0.03 | 2.66 | |
| DAPORollouts per prompt (K)=8, Number of training epochs=32026.06 | 1.11 | — | 2.1 | 0.02 | 3.23 | |
| DAPO (with forking tokens)Rollouts per prompt (K)=8, Number of training epochs=32026.06 | 1.12 | — | 2.12 | 0.01 | 3.25 |