Mathematical Reasoning on Polaris (test)
4.92Cumulative Rollouts (M)DAPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DAPOModel Scale=14B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=57.0%*2026.05 | 4.92 | — | — | |
| GRPOModel Scale=14B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=57.0%*2026.05 | 4.1 | — | — | |
| DAPOModel Scale=8B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=47.3%2026.05 | 2.7 | — | — | |
| GRPOModel Scale=4B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=47.3%*2026.05 | 2.5 | — | — | |
| Pilot-CommitModel Scale=14B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=57.0%*2026.05 | 2.15 | 1.9 | 2.3 | |
| DAPOModel Scale=4B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=45.0%2026.05 | 1.69 | — | — | |
| Pilot-CommitModel Scale=4B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=47.3%*2026.05 | 1.66 | 1.5 | — | |
| GRPOModel Scale=8B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=47.3%2026.05 | 1.56 | — | — | |
| DAPOModel Scale=8B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=47.1%2026.05 | 1.26 | — | — | |
| Pilot-CommitModel Scale=8B, Budget Type=ample, Rollout count per prompt (n)=64, Target Accuracy=47.3%2026.05 | 1.04 | 1.5 | 2.6 | |
| GRPOModel Scale=4B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=45.0%2026.05 | 0.73 | — | — | |
| GRPOModel Scale=8B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=47.1%2026.05 | 0.63 | — | — | |
| GRPOModel Scale=14B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=54.3%2026.05 | 0.52 | — | — | |
| Pilot-CommitModel Scale=4B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=45.0%2026.05 | 0.51 | 1.4 | 3.3 | |
| Pilot-CommitModel Scale=14B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=54.3%2026.05 | 0.51 | 1 | — | |
| Pilot-CommitModel Scale=8B, Budget Type=limited, Rollout count per prompt (n)=16, Target Accuracy=47.1%2026.05 | 0.47 | 1.3 | 2.7 |