Mathematical Reasoning on AIME25 (Pass@1, FS, N/T, D/T, Repro)
72.2Pass@1RED
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| REDModel=Qwen3-32B-Thinking2026.04 | 72.2 | 3.1 | 4.2 | 3.1 | 2.6 | |
| S-GRROModel=Qwen3-32B-Thinking2026.04 | 71.1 | 6.1 | 7 | 5.1 | 7.4 | |
| VanillaModel=Qwen3-32B-Thinking2026.04 | 68.9 | 6.8 | 7.4 | 5.3 | 8.1 | |
| DEERModel=Qwen3-32B-Thinking2026.04 | 66.7 | 6.3 | 7.2 | 5.4 | 8.3 | |
| RL + LPModel=Qwen3-32B-Thinking2026.04 | 66.7 | 5.9 | 6.9 | 4.7 | 7.1 | |
| REDModel=R1-Qwen-32B2026.04 | 63.3 | 3.2 | 4.6 | 3.6 | 4 | |
| RL + LPModel=R1-Qwen-32B2026.04 | 62.2 | 6.1 | 7.3 | 5.2 | 8.5 | |
| S-GRROModel=R1-Qwen-32B2026.04 | 60 | 6.3 | 7.4 | 5.6 | 8.8 | |
| VanillaModel=R1-Qwen-32B2026.04 | 58.9 | 7 | 7.8 | 5.8 | 9.5 | |
| DEERModel=R1-Qwen-32B2026.04 | 57.8 | 6.5 | 7.6 | 5.9 | 9.7 | |
| REDModel=R1-Llama-70B2026.04 | 50 | 3.9 | 4.7 | 3.7 | 4 | |
| DEERModel=R1-Llama-70B2026.04 | 48.9 | 7.9 | 7.8 | 6.5 | 12.8 | |
| S-GRROModel=R1-Llama-70B2026.04 | 48.9 | 7.8 | 7.6 | 6.1 | 11.5 | |
| VanillaModel=R1-Llama-70B2026.04 | 47.8 | 8.6 | 8.3 | 6.4 | 12.5 | |
| RL + LPModel=R1-Llama-70B2026.04 | 45.6 | 7.6 | 7.5 | 5.8 | 11 | |
| NUDGERLModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 39.3 | — | — | — | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=322026.05 | 37 | — | — | — | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 36.7 | — | — | — | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=162026.05 | 35.5 | — | — | — | — | |
| Base modelModel=Qwen3-4B-Instruct, Rollouts (N)=–2026.05 | 35.2 | — | — | — | — | |
| POPEModel=Qwen3-4B-Instruct, Rollouts (N)=82026.05 | 33.7 | — | — | — | — | |
| GRPOModel=Qwen3-4B-Instruct, Rollouts (N)=642026.05 | 32.4 | — | — | — | — | |
| NUDGERLModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 17.9 | — | — | — | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=162026.05 | 17.6 | — | — | — | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=322026.05 | 17.6 | — | — | — | — | |
| POPEModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 16.9 | — | — | — | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=82026.05 | 15.9 | — | — | — | — | |
| Base modelModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=–2026.05 | 11.8 | — | — | — | — | |
| GRPOModel=Olmo3-7B-Instruct-SFT, Rollouts (N)=642026.05 | 5.3 | — | — | — | — |