Mathematical Reasoning on AIME 25 (Peak Accuracy)
27.5Peak Accuracy14B-PC
Evaluation Results
| Method | Links | |
|---|---|---|
| 14B-PCModel Scale=14B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 27.5 | |
| 14B-GRPOModel Scale=14B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 23.6 | |
| 14B-DAPOModel Scale=14B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 21.9 | |
| 8B-PCModel Scale=8B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 21.4 | |
| 8B-DAPOModel Scale=8B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 20.8 | |
| 4B-PCModel Scale=4B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 19.6 | |
| 4B-DAPOModel Scale=4B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 19.1 | |
| 4B-GRPOModel Scale=4B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 17.4 | |
| 8B-GRPOModel Scale=8B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 16.6 | |
| 1.5B-PCModel Scale=1.5B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 15.3 | |
| 1.5B-DAPOModel Scale=1.5B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 14.5 | |
| 1.5B-GRPOModel Scale=1.5B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 14.3 |