Mathematical Reasoning on MATH 500 (Pass@k Metrics)
98.5Pass@1CRAFT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CRAFTBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 98.5 | — | — | |
| BaseBackbone=Qwen3-4B-thinking2026.03 | 95.2 | — | — | |
| CRAFTBackbone=Qwen3-4B-thinking2026.03 | 92.4 | — | — | |
| SafeKeyBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 92 | — | — | |
| SFT→RLBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 92 | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 91.8 | — | — | |
| IPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 91.6 | — | — | |
| MELBackbone=Qwen3-14B-Base2026.02 | 90.8 | 90.8 | 97.2 | |
| IPOBackbone=Qwen3-4B-thinking2026.03 | 90.3 | — | — | |
| SafeKeyBackbone=Qwen3-4B-thinking2026.03 | 90.1 | — | — | |
| SFTBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 90 | — | — | |
| RealSafeBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 89.8 | — | — | |
| SRFT [13]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 89.8 | — | — | |
| ReasoningShieldBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 89.6 | — | — | |
| STARBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 89.4 | — | — | |
| HPT [15]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 89.2 | — | — | |
| Prefix-RFT [14]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 88.4 | — | — | |
| ReLIFT [12]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 87.9 | — | — | |
| DeepScaleR-1.5B-PreviewZero-shot=true, Fine-tuning Samples=40,0002025.05 | 87.8 | — | — | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 87.6 | — | — | |
| SafeChainBackbone=DeepSeek-R1-Distill-Llama-8B2026.03 | 87 | — | — | |
| MELBackbone=Qwen3-8B-Base2026.02 | 86.6 | 86.7 | 96.2 | |
| STARBackbone=Qwen3-4B-thinking2026.03 | 86.3 | — | — | |
| DRA-GRPO (Ours)Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 86.2 | — | — | |
| ReLIFT [12]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 86.2 | — | — | |
| GRPO†Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 86 | — | — | |
| o1-previewZero-shot=true2025.05 | 85.5 | — | — | |
| Open-RS2Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 85.4 | — | — | |
| DRA-DR. GRPO (Ours)Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 85.2 | — | — | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 85.2 | — | — | |
| RealSafeBackbone=Qwen3-4B-thinking2026.03 | 85.1 | — | — | |
| GRPOBackbone=Qwen3-14B-Base2026.02 | 85 | 88.35 | 96.4 | |
| SafeChainBackbone=Qwen3-4B-thinking2026.03 | 85 | — | — | |
| GRPOBackbone=Qwen3-8B-Base2026.02 | 84.4 | 86.28 | 95.4 | |
| Still-3-1.5B-PreviewZero-shot=true, Fine-tuning Samples=30,0002025.05 | 84.4 | — | — | |
| Open-RS3Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 84.4 | — | — | |
| Open-RS1Zero-shot=true, Fine-tuning Samples=18,6152025.05 | 83.8 | — | — | |
| DR. GRPO†Zero-shot=true, Fine-tuning Samples=7,0002025.05 | 83.4 | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BZero-shot=true, Fine-tuning Samples=Base Model2025.05 | 82.8 | — | — | |
| Qwen2.5-7B-SimpleRLZero-shot=true2025.05 | 82.4 | — | — | |
| MELBackbone=Qwen3-4B-Base2026.02 | 82.2 | 82.3 | 93.8 | |
| GRPOBackbone=Qwen3-4B-Base2026.02 | 81.8 | 82.2 | 93 | |
| APMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 81.6 | — | — | |
| BaselineBackbone=Qwen3-14B-Base2026.02 | 80.8 | 74.15 | 93.6 | |
| Qwen-2.5-Math-7B-InstructZero-shot=true2025.05 | 79.8 | — | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 79.8 | — | — | |
| Eurus-2-7B-PRIMEZero-shot=true2025.05 | 79.2 | — | — | |
| rStar-Math-7BZero-shot=true2025.05 | 78.4 | — | — | |
| APMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 78 | — | — | |
| DAPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 77.2 | — | — | |
| BaselineBackbone=Qwen3-8B-Base2026.02 | 77 | 73.4 | 91.4 | |
| GMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 76.6 | — | — | |
| GMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 76.6 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 75.4 | — | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 75.2 | — | — | |
| BaselineBackbone=Qwen3-4B-Base2026.02 | 74.2 | 65.74 | 89.6 | |
| BaseBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 74.2 | — | — | |
| ReasoningShieldBackbone=Qwen3-4B-thinking2026.03 | 73.9 | — | — | |
| INFOTREE2026.05 | 69.8 | — | — | |
| APMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 68.4 | — | — | |
| DAPOBackbone=Qwen2.5-3B-Instruct2026.04 | 67.6 | — | — | |
| Tree-GRPO2026.05 | 67.2 | — | — | |
| GMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 66.8 | — | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.04 | 66 | — | — | |
| Llama-3.1-70B-InstructZero-shot=true2025.05 | 64.6 | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 64.6 | — | — | |
| Flat GRPO2026.05 | 63.1 | — | — | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.04 | 62 | — | — |