Mathematical Problem Solving on Minerva Math
39.7Peak AccuracyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 39.7 | |
| DAPOModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 39.3 | |
| PCModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 39 | |
| PCModel Scale=14B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 39 | |
| DAPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 37.1 | |
| PCModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=12,2882026.05 | 36.8 | |
| GRPOModel Scale=8B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 36 | |
| DAPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=24,5762026.05 | 35.3 | |
| GRPOModel Scale=4B, n (Rollout Budget)=64, Rollouts Trained=8,192, Rollouts Sampled=8,1922026.05 | 34.9 | |
| GRPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=16,3842026.05 | 29.8 | |
| DAPOModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=49,1522026.05 | 29.8 | |
| PCModel Scale=1.5B, n (Rollout Budget)=128, Rollouts Trained=16,384, Rollouts Sampled=24,5762026.05 | 29 |