Mathematical Reasoning on AMC 2023 (Pass@1)
88.2Pass@1GC2PO
Evaluation Results
| Method | Links | |
|---|---|---|
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 88.2 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 87.5 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 87.3 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 86.4 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 86.3 | |
| GC2POBackbone=DeepScaleR-1.5B-Preview2026.02 | 86.1 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 86 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 85.7 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 85.5 | |
| L2T-GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 85.4 | |
| DeepSeek-R1-Distill-Qwen-7BFine-tuning=None2026.02 | 85.1 | |
| GCPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 84.1 | |
| GVPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 83.6 | |
| ReST-MCTSBackbone=DeepScaleR-1.5B-Preview2026.02 | 83.4 | |
| MRTBackbone=DeepScaleR-1.5B-Preview2026.02 | 83.1 | |
| DeepScaleR-1.5B-PreviewFine-tuning=None2026.02 | 83 | |
| Dr.GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 82.1 | |
| GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 81.5 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 81.2 | |
| Base ModelBackbone=Qwen-3-4B-Base2026.03 | 77.5 | |
| length penaltyBackbone=DeepScaleR-1.5B-Preview2026.02 | 77.3 | |
| ARISE + GRPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 75.4 | |
| SAGEBackbone=Qwen-3-4B-Base2026.03 | 75 | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 74.3 | |
| DAPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 74.2 | |
| GSPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 73.8 | |
| EvolveR + GRPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 73.6 | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 73.5 | |
| SimpleMem + GRPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 73.1 | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 72.9 | |
| GRPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 72.9 | |
| Dr.GRPOBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 72.8 | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 71.8 | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 71.5 | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 71.3 | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 71.1 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 70.5 | |
| MAEBackbone=Qwen-3-4B-Base2026.03 | 70 | |
| DeepSeek-R1-Distill-Qwen-1.5BFine-tuning=None2026.02 | 69.9 | |
| BaselineBase Model=Qwen3-4B-Instruct-2507, Training Dataset=DeepScaleR, G=82026.03 | 69.6 | |
| DeepCompress-Zero-7BParameters=7B, Training=DeepCompress2025.10 | 67.8 | |
| DeepMath-Zero-7BParameters=7B, Training=Zero RL2025.10 | 64.7 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 64.4 | |
| Open-Reasoner-Zero-7BParameters=7B, Training=Zero RL2025.10 | 58.9 | |
| Base ModelBackbone=Qwen-2.5-7B-Instruct2026.03 | 57.5 | |
| Qwen-2.5-7B-SRL-ZooParameters=7B, Variant=SRL-Zoo2025.10 | 55.8 | |
| SAGEBackbone=Qwen-2.5-7B-Instruct2026.03 | 52.5 | |
| AZRBackbone=Qwen-2.5-7B-Instruct2026.03 | 50 | |
| AZRBackbone=Qwen-3-4B-Base2026.03 | 50 | |
| DeepCompress-Zero-3BParameters=3B, Training=DeepCompress2025.10 | 49.4 | |
| DeepMath-Zero-3BParameters=3B, Training=Zero RL2025.10 | 48 | |
| ARISE + GRPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 45.3 | |
| DAPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 44.1 | |
| GSPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 43.6 | |
| EvolveR + GRPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 43.2 | |
| SimpleMem + GRPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 43 | |
| GRPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 42.7 | |
| MAEBackbone=Qwen-2.5-7B-Instruct2026.03 | 42.5 | |
| Dr.GRPOBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 42.5 | |
| Qwen-2.5-3B-InstructParameters=3B, Variant=Instruct2025.10 | 42.5 | |
| Base ModelBackbone=Qwen-2.5-3B-Instruct2026.03 | 40 | |
| BaselineBase Model=Phi-4-mini-instruct-3.8B, Training Dataset=DeepScaleR, G=82026.03 | 36.3 | |
| Qwen-2.5-7BParameters=7B2025.10 | 35.3 | |
| AZRBackbone=Qwen-2.5-3B-Instruct2026.03 | 35 | |
| SAGEBackbone=Qwen-2.5-3B-Instruct2026.03 | 35 | |
| MAEBackbone=Qwen-2.5-3B-Instruct2026.03 | 32.5 | |
| Qwen-2.5-3BParameters=3B2025.10 | 24.2 |