Mathematical Reasoning on AIME 2025 (Pass@1, FS, N/T, D/T, Repro)
72.2Pass@1 AccuracyRED
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| REDBackbone=Qwen3-32B-thinking2026.04 | 72.2 | 3.1 | 4.2 | 3.1 | 0.026 | |
| S-GRPOBackbone=Qwen3-32B-thinking2026.04 | 71.1 | 6.1 | 7 | 5.1 | 0.074 | |
| VanillaBackbone=Qwen3-32B-thinking2026.04 | 68.9 | 6.8 | 7.4 | 5.3 | 0.081 | |
| DEERBackbone=Qwen3-32B-thinking2026.04 | 66.7 | 6.3 | 7.2 | 5.4 | 0.083 | |
| RL + LPBackbone=Qwen3-32B-thinking2026.04 | 66.7 | 5.9 | 6.9 | 4.7 | 0.071 | |
| REDBackbone=R1-Qwen-32B2026.04 | 63.3 | 3.2 | 4.6 | 3.6 | 0.04 | |
| RL + LPBackbone=R1-Qwen-32B2026.04 | 62.2 | 6.1 | 7.3 | 5.2 | 0.085 | |
| S-GRPOBackbone=R1-Qwen-32B2026.04 | 60 | 6.3 | 7.4 | 5.6 | 0.088 | |
| VanillaBackbone=R1-Qwen-32B2026.04 | 58.9 | 7 | 7.8 | 5.8 | 0.095 | |
| DEERBackbone=R1-Qwen-32B2026.04 | 57.8 | 6.5 | 7.6 | 5.9 | 0.097 | |
| REDBackbone=R1-Llama-70B2026.04 | 50 | 3.9 | 4.7 | 3.7 | 0.04 | |
| DEERBackbone=R1-Llama-70B2026.04 | 48.9 | 7.9 | 7.8 | 6.5 | 0.128 | |
| S-GRPOBackbone=R1-Llama-70B2026.04 | 48.9 | 7.8 | 7.6 | 6.1 | 0.115 | |
| VanillaBackbone=R1-Llama-70B2026.04 | 47.8 | 8.6 | 8.3 | 6.4 | 0.125 | |
| RL + LPBackbone=R1-Llama-70B2026.04 | 45.6 | 7.6 | 7.5 | 5.8 | 0.11 |