Mathematical Reasoning on MATH500 Level-5 (pass@1)
67.4Pass@1 RateGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=322026.05 | 67.4 | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 66.8 | — | |
| NUDGERLModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 66 | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=162026.05 | 65.5 | — | |
| POPEModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 65.2 | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=642026.05 | 64.1 | — | |
| Base modelModel=Qwen3-4B-Instruct, Rollouts (N)=–2026.05 | 59.2 | — | |
| NUDGERLModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 46.8 | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=162026.05 | 46.1 | — | |
| POPEModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 46 | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=322026.05 | 45.9 | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 43.4 | — | |
| Base modelModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=–2026.05 | 38.4 | — | |
| GRPO + RandomBackbone=Qwen2.5-Math-7B-Base2026.05 | 34 | 78.2 | |
| GRPO + BranchBackbone=Qwen2.5-Math-7B-Base2026.05 | 32.2 | 79.4 | |
| GRPO w/o KLBackbone=Qwen2.5-Math-7B-Base2026.05 | 31.9 | 76.3 | |
| GRPO + Forward KLBackbone=Qwen2.5-Math-7B-Base2026.05 | 31.8 | 77.2 | |
| GRPOBackbone=Qwen2.5-Math-7B-Base2026.05 | 31.5 | 77.5 | |
| GRPO + TokenBackbone=Qwen2.5-Math-7B-Base2026.05 | 30.3 | 76.9 | |
| Base ModelBackbone=Qwen2.5-Math-7B-Base2026.05 | 29.4 | 78.1 | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=642026.05 | 29.1 | — |