Mathematical Reasoning on AMO-Bench (pass@1)
2.6Pass@1 ScoreFP8 Rollout P3O
Evaluation Results
| Method | Links | |
|---|---|---|
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=30, Rollout Precision=FP8, Training Precision=BF162026.05 | 2.6 | |
| FP8 Rollout P3ORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 2.4 | |
| FP8 Rollout GRPORollout Length=16K tokens, Training Iteration=15, Rollout Precision=FP8, Training Precision=BF162026.05 | 2.1 | |
| Baseline ModelRollout Length=16K tokens2026.05 | 1.9 | |
| FP8 Rollout GRPORollout Length=16K tokens, Training Iteration=30, Rollout Precision=FP8, Training Precision=BF162026.05 | 1.9 | |
| GRPO (clip avg)Rollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 1.2 | |
| P3ORollout Length=4K tokens, Clipping Parameter (epsilon)=∈ {0.2, 0.4, 0.6}2026.05 | 1 | |
| Baseline ModelRollout Length=4K tokens2026.05 | 0.7 |