Mathematical Reasoning on AMC 23 (Peak Accuracy)
84.2Peak Accuracy14B-PC
Evaluation Results
| Method | Links | |
|---|---|---|
| 14B-PCModel Scale=14B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 84.2 | |
| 14B-GRPOModel Scale=14B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 78.7 | |
| 14B-DAPOModel Scale=14B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 75.2 | |
| 8B-PCModel Scale=8B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 73.5 | |
| 8B-DAPOModel Scale=8B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 72.8 | |
| 4B-DAPOModel Scale=4B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 69.5 | |
| 4B-PCModel Scale=4B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 69.4 | |
| 8B-GRPOModel Scale=8B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 67.7 | |
| 4B-GRPOModel Scale=4B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 65.5 | |
| 1.5B-PCModel Scale=1.5B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 61.7 | |
| 1.5B-DAPOModel Scale=1.5B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 59.5 | |
| 1.5B-GRPOModel Scale=1.5B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 57.8 |