Mathematical Problem Solving on MATH 500 (Peak Accuracy)
91Peak AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 91 | |
| PCModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 90 | |
| GRPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 89.6 | |
| DAPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 87 | |
| PCModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 86.4 | |
| PCModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 84.8 | |
| PCModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=24,5762026.05 | 83.2 | |
| GRPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 83.2 | |
| DAPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 83 | |
| GRPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 82.8 | |
| DAPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=49,1522026.05 | 81.8 | |
| GRPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=16,3842026.05 | 80.8 |