Mathematical Reasoning on DeepMath (Peak Accuracy)
78Peak AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 78 | |
| GRPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 77.4 | |
| PCModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 76.6 | |
| 14B-PCModel Scale=14B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 75.6 | |
| 14B-GRPOModel Scale=14B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 74.4 | |
| 14B-DAPOModel Scale=14B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 73.4 | |
| PCModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=24,5762026.05 | 72.6 | |
| PCModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 71.6 | |
| DAPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=49,1522026.05 | 71 | |
| DAPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 70.2 | |
| 8B-DAPOModel Scale=8B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 69.6 | |
| GRPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=16,3842026.05 | 69.4 | |
| 8B-PCModel Scale=8B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 68 | |
| 4B-DAPOModel Scale=4B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 67 | |
| PCModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 67 | |
| 8B-GRPOModel Scale=8B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 66.4 | |
| GRPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 66.2 | |
| 4B-PCModel Scale=4B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 65.8 | |
| DAPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 65.6 | |
| 1.5B-PCModel Scale=1.5B, RL Algorithm=PC, Rollouts Trained=2,048, Rollouts Sampled=4,0962026.05 | 65.2 | |
| 1.5B-DAPOModel Scale=1.5B, RL Algorithm=DAPO, Rollouts Trained=2,048, Rollouts Sampled=6,1442026.05 | 65 | |
| GRPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 64.2 | |
| 1.5B-GRPOModel Scale=1.5B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 64 | |
| 4B-GRPOModel Scale=4B, RL Algorithm=GRPO, Rollouts Trained=2,048, Rollouts Sampled=2,0482026.05 | 62.2 |