Mathematical Problem Solving on Olympiad Bench (Peak Accuracy)
59.3Peak AccuracyDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 59.3 | |
| GRPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 58.5 | |
| PCModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 57.3 | |
| PCModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 52.1 | |
| DAPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 51.2 | |
| PCModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 49.9 | |
| GRPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 49 | |
| GRPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 48.4 | |
| DAPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 46.9 | |
| DAPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=49,1522026.05 | 46.3 | |
| PCModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=24,5762026.05 | 45.3 | |
| GRPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=16,3842026.05 | 44.1 |