Mathematical Problem Solving on AIME 2024 (Peak Accuracy)
40.2Peak AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 40.2 | |
| GRPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 40.1 | |
| PCModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 39.9 | |
| DAPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 29.3 | |
| GRPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 27.4 | |
| PCModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 27.3 | |
| GRPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 24.7 | |
| PCModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 23.4 | |
| DAPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 23.2 | |
| PCModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=24,5762026.05 | 20.2 | |
| GRPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=16,3842026.05 | 18.6 | |
| DAPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=49,1522026.05 | 18.6 |