Mathematical Reasoning on Minerva Math (Peak Accuracy)
39.3Peak Accuracy14B-PC
Evaluation Results
| Method | Links | |
|---|---|---|
| 14B-PCModel Scale=14B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 39.3 | |
| 8B-PCModel Scale=8B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 39 | |
| 14B-GRPOModel Scale=14B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 38.6 | |
| 8B-GRPOModel Scale=8B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 38.2 | |
| 14B-DAPOModel Scale=14B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 38.2 | |
| 8B-DAPOModel Scale=8B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 37.5 | |
| 4B-PCModel Scale=4B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 36.8 | |
| 4B-GRPOModel Scale=4B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 35.3 | |
| 4B-DAPOModel Scale=4B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 34.6 | |
| 1.5B-DAPOModel Scale=1.5B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 29.4 | |
| 1.5B-GRPOModel Scale=1.5B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 28.7 | |
| 1.5B-PCModel Scale=1.5B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 28.7 |