Mathematical Reasoning on AMC (pass@32, Overall)
85.3Average Pass@32Qwen3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen3Model Category=Original Models2026.05 | 85.3 | — | — | |
| ConSPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 83.8 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.8 | — | — | |
| Dr. GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82.2 | — | — | |
| DisCOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 82 | — | — | |
| ConSPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 81.1 | — | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 80.6 | — | — | |
| Dr. GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 80.5 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 78.6 | — | — | |
| DisCOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 78.4 | — | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 77.6 | — | — | |
| EAPOMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 75.5 | 95.5 | 57 | |
| KL-CovMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 75 | 91 | 56.5 | |
| EntroAdvMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 73.9 | 92.9 | 56.3 | |
| DAPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 73.6 | 90.8 | 55.1 | |
| GRPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 71.4 | 92.4 | 53.9 | |
| ForkingMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 71 | 90.7 | 53.7 | |
| ConSPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 70.4 | — | — | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 70.3 | — | — | |
| EntroRegMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 70.2 | 90.6 | 51.9 | |
| SAPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 70.1 | — | — | |
| GMPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 70 | — | — | |
| W-REINFMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 69.8 | 91 | 51.8 | |
| Base-1.5BMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 69.4 | 89.9 | 50.7 | |
| DisCOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 66.5 | — | — | |
| DAPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 66.2 | — | — | |
| CISPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 65.2 | — | — | |
| GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 64.4 | — | — | |
| Base ModelBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 63.5 | — | — | |
| Dr. GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 63.5 | — | — | |
| Oat-ZeroModel Category=On-Policy Methods2026.05 | 61.2 | — | — | |
| TGPO-annealingModel Category=On-Policy Methods2026.05 | 60.2 | — | — | |
| TGPOModel Category=On-Policy Methods2026.05 | 58.6 | — | — | |
| TGPORModel Category=On-Policy Methods2026.05 | 58.4 | — | — | |
| GRPO++Model Category=On-Policy Methods2026.05 | 58.3 | — | — | |
| LUFFYModel Category=Off-Policy and Mixed-Policy2026.05 | 57.6 | — | — | |
| KDRLModel Category=On-Policy Methods2026.05 | 55.8 | — | — | |
| SimpleRL-ZeroModel Category=On-Policy Methods2026.05 | 54.9 | — | — | |
| PRIME-ZeroModel Category=On-Policy Methods2026.05 | 54 | — | — | |
| Base ModelBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 52.8 | — | — | |
| Qwen3-8192Model Category=Original Models, Max Generation Length=81922026.05 | 52.2 | — | — | |
| SFTModel Category=Off-Policy and Mixed-Policy2026.05 | 45.3 | — | — | |
| Qwen2.5-Math-7BModel Category=Original Models2026.05 | 31.3 | — | — | |
| OP DistillModel Category=On-Policy Methods2026.05 | 29.9 | — | — | |
| AV-GRPOAlgorithm=AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 81.9 | 50.9 | |
| BaseBackbone=Qwen2.5-7B-Instruct2025.08 | — | 52.58 | — | |
| BaseBackbone=Llama3.1-8B-Instruct2025.08 | — | 24.45 | — | |
| CDA-GRPOAlgorithm=CDA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 85.5 | 49 | |
| FA-GRPOAlgorithm=FA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 83.1 | 49.9 | |
| GRPOAlgorithm=GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 84.3 | 47.8 | |
| Llama3.1-8B-InstructTraining Pipeline=SFT2025.08 | — | 47.19 | — | |
| Llama3.1-8B-InstructTraining Pipeline=SFT → GRPO2025.08 | — | 54.38 | — | |
| Llama3.1-8B-InstructTraining Pipeline=PSFT2025.08 | — | 46.8 | — | |
| Llama3.1-8B-InstructTraining Pipeline=PSFT → GRPO2025.08 | — | 55.23 | — | |
| MSA-GRPOAlgorithm=MSA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 84.3 | 50.7 | |
| PR-GRPOAlgorithm=PR-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 80.7 | 49.4 | |
| PSFTBackbone=Qwen2.5-7B-Instruct2025.08 | — | 62.34 | — | |
| PSFTBackbone=Llama3.1-8B-Instruct2025.08 | — | 46.8 | — | |
| PSFTwarm-upBackbone=Qwen2.5-7B-Instruct2025.08 | — | 62.42 | — | |
| PSFTwarm-upBackbone=Llama3.1-8B-Instruct2025.08 | — | 49.45 | — | |
| Qwen2.5-7B-InstructTraining Pipeline=SFT2025.08 | — | 62.73 | — | |
| Qwen2.5-7B-InstructTraining Pipeline=SFT → GRPO2025.08 | — | 70.86 | — | |
| Qwen2.5-7B-InstructTraining Pipeline=PSFT2025.08 | — | 62.34 | — | |
| Qwen2.5-7B-InstructTraining Pipeline=PSFT → GRPO2025.08 | — | 71.72 | — | |
| SFTBackbone=Qwen2.5-7B-Instruct2025.08 | — | 62.73 | — | |
| SFTBackbone=Llama3.1-8B-Instruct2025.08 | — | 47.19 | — | |
| SFT-KLBackbone=Qwen2.5-7B-Instruct2025.08 | — | 63.2 | — | |
| SFT-KLBackbone=Llama3.1-8B-Instruct2025.08 | — | 45.55 | — | |
| SVE-LNA-GRPOAlgorithm=SVE-LNA-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 89.2 | 48.7 | |
| VM-AV-GRPOAlgorithm=VM-AV-GRPO, Backbone=Qwen2.5-Math-1.5B2026.03 | — | 88 | 52.5 |