Mathematical Reasoning on Olympiad Bench (Peak Accuracy)
0.57Peak Accuracy14B-PC
Evaluation Results
| Method | Links | |
|---|---|---|
| 14B-PCModel Scale=14B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 0.57 | |
| 14B-GRPOModel Scale=14B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 0.567 | |
| 14B-DAPOModel Scale=14B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 0.527 | |
| 8B-DAPOModel Scale=8B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 0.525 | |
| 8B-PCModel Scale=8B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 0.507 | |
| 4B-PCModel Scale=4B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 0.497 | |
| 4B-DAPOModel Scale=4B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 0.476 | |
| 4B-GRPOModel Scale=4B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 0.47 | |
| 8B-GRPOModel Scale=8B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 0.457 | |
| 1.5B-DAPOModel Scale=1.5B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 0.43 | |
| 1.5B-PCModel Scale=1.5B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 0.43 | |
| 1.5B-GRPOModel Scale=1.5B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 0.418 |