Mathematical Reasoning on Math Benchmarks Aggregate
71.8Pass@1GC2PO
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 71.8 | — | — | — | — | — | — | — | — | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 71.1 | — | — | — | — | — | — | — | — | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 70.9 | — | — | — | — | — | — | — | — | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 70.3 | — | — | — | — | — | — | — | — | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 70.1 | — | — | — | — | — | — | — | — | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 70.1 | — | — | — | — | — | — | — | — | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 69.7 | — | — | — | — | — | — | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 69.6 | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-7BFine-tuning=None2026.02 | 68.6 | — | — | — | — | — | — | — | — | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-7B2026.02 | 66 | — | — | — | — | — | — | — | — | |
| GC2POBackbone=DeepScaleR-1.5B-Preview2026.02 | 63.9 | — | — | — | — | — | — | — | — | |
| L2T-GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 63.3 | — | — | — | — | — | — | — | — | |
| GCPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 62.3 | — | — | — | — | — | — | — | — | |
| GVPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 61.8 | — | — | — | — | — | — | — | — | |
| MRTBackbone=DeepScaleR-1.5B-Preview2026.02 | 61.5 | — | — | — | — | — | — | — | — | |
| Dr.GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 61.3 | — | — | — | — | — | — | — | — | |
| ReST-MCTSBackbone=DeepScaleR-1.5B-Preview2026.02 | 61.2 | — | — | — | — | — | — | — | — | |
| GRPOBackbone=DeepScaleR-1.5B-Preview2026.02 | 60.7 | — | — | — | — | — | — | — | — | |
| DeepScaleR-1.5B-PreviewFine-tuning=None2026.02 | 60.3 | — | — | — | — | — | — | — | — | |
| length penaltyBackbone=DeepScaleR-1.5B-Preview2026.02 | 57.1 | — | — | — | — | — | — | — | — | |
| GC2POBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 55.9 | — | — | — | — | — | — | — | — | |
| L2T-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 55.2 | — | — | — | — | — | — | — | — | |
| GCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 53.7 | — | — | — | — | — | — | — | — | |
| MRTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 53.4 | — | — | — | — | — | — | — | — | |
| GVPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 53.2 | — | — | — | — | — | — | — | — | |
| Dr.GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 53.1 | — | — | — | — | — | — | — | — | |
| ReST-MCTSBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 52.6 | — | — | — | — | — | — | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 52.4 | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BFine-tuning=None2026.02 | 51.3 | — | — | — | — | — | — | — | — | |
| APOBackbone=Qwen2.5-Math-7B2026.02 | 50.67 | — | — | — | — | — | — | — | 78.07 | |
| length penaltyBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.02 | 48.8 | — | — | — | — | — | — | — | — | |
| GRPO (Baseline)Backbone=Qwen2.5-Math-7B2026.02 | 48.68 | — | — | — | — | — | — | — | 76.56 | |
| NSRBackbone=Qwen2.5-Math-7B2026.02 | 48.58 | — | — | — | — | — | — | — | 77.4 | |
| GRPO-KL (Error-Only)Backbone=Qwen2.5-Math-7B2026.02 | 46.79 | — | — | — | — | — | — | — | 75.05 | |
| GRPO-KLBackbone=Qwen2.5-Math-7B2026.02 | 44.53 | — | — | — | — | — | — | — | 75.07 | |
| APOBackbone=Qwen2.5-7B2026.02 | 43.57 | — | — | — | — | — | — | — | 73.38 | |
| GRPO (Baseline)Backbone=Qwen2.5-7B2026.02 | 42.68 | — | — | — | — | — | — | — | 70.57 | |
| GRPO-KLBackbone=Qwen2.5-7B2026.02 | 37.83 | — | — | — | — | — | — | — | 72.94 | |
| Base ModelBackbone=Qwen2.5-Math-7B2026.02 | 27.7 | — | — | — | — | — | — | — | 76.95 | |
| APOBackbone=Llama-3.2-3B-Instruct2026.02 | 25.51 | — | — | — | — | — | — | — | 47.11 | |
| GRPO (Baseline)Backbone=Llama-3.2-3B-Instruct2026.02 | 25.08 | — | — | — | — | — | — | — | 43.82 | |
| Base ModelBackbone=Qwen2.5-7B2026.02 | 22.44 | — | — | — | — | — | — | — | 71.92 | |
| GRPO-KLBackbone=Llama-3.2-3B-Instruct2026.02 | 21.99 | — | — | — | — | — | — | — | 46.95 | |
| Base ModelBackbone=Llama-3.2-3B-Instruct2026.02 | 18.79 | — | — | — | — | — | — | — | 55.11 | |
| AdamBackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 44.1 | 54.5 | 40.5 | 44.3 | 51.4 | 18.4 | 55.4 | — | |
| BAdamBackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 44.4 | 48.1 | 42.5 | 50.5 | 56.8 | 15.7 | 53 | — | |
| BAdamBackbone=Llama 3-70B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 62.7 | 78.8 | 63.4 | 64.2 | 76.4 | 26.2 | 67.3 | — | |
| Base modelBackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=None2024.04 | — | 28.2 | 25.9 | 22.8 | 33.7 | 39.5 | 12.8 | 34.5 | — | |
| Base modelBackbone=Llama 3-70B, Evaluation Protocol=Zero-shot, Finetuning Dataset=None2024.04 | — | 44.7 | 52.4 | 46.5 | 52.2 | 58.2 | 21.2 | 37.9 | — | |
| FalconSize=7B2023.07 | — | 4.6 | — | — | — | — | — | — | — | |
| FalconSize=40B2023.07 | — | 12.6 | — | — | — | — | — | — | — | |
| GaloreBackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 34.4 | 33.1 | 37.4 | 41.2 | 42.7 | 15 | 36.9 | — | |
| GRPOBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 65.4 | |
| GRPOBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 63.1 | |
| LLAMA 1Size=7B2023.07 | — | 6.95 | — | — | — | — | — | — | — | |
| LLAMA 1Size=13B2023.07 | — | 10.9 | — | — | — | — | — | — | — | |
| LLAMA 1Size=33B2023.07 | — | 21.4 | — | — | — | — | — | — | — | |
| LLAMA 1Size=65B2023.07 | — | 30.8 | — | — | — | — | — | — | — | |
| LLAMA 2Size=7B2023.07 | — | 14.6 | — | — | — | — | — | — | — | |
| LLAMA 2Size=13B2023.07 | — | 28.7 | — | — | — | — | — | — | — | |
| LLAMA 2Size=34B2023.07 | — | 24.2 | — | — | — | — | — | — | — | |
| LLAMA 2Size=70B2023.07 | — | 35.2 | — | — | — | — | — | — | — | |
| LOMOBackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 31.6 | 32.1 | 28 | 40 | 39.5 | 13.1 | 37.1 | — | |
| LoRABackbone=Llama 3-8B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 43.3 | 47.5 | 44.9 | 45.3 | 50.9 | 14.5 | 56.9 | — | |
| LoRABackbone=Llama 3-70B, Evaluation Protocol=Zero-shot, Finetuning Dataset=MathInstruct2024.04 | — | 59 | 73.3 | 59.5 | 58.3 | 64.1 | 34.2 | 64.8 | — | |
| MPTSize=7B2023.07 | — | 4.9 | — | — | — | — | — | — | — | |
| MPTSize=30B2023.07 | — | 9.1 | — | — | — | — | — | — | — | |
| Olmo-3-7B-InstructBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 62.3 | |
| Qwen3-4B-InstructBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 66.7 | |
| RFTBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 69.8 | |
| RFTBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 65.7 | |
| SD-ZEROBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 72.5 | |
| SD-ZEROBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 70.8 | |
| SDFTBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 65.5 | |
| SDFTBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 64.2 | |
| SFTBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 64.6 | |
| SFTBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 60.9 | |
| SRTBase Model=Qwen3-4B-Instruct2026.04 | — | — | — | — | — | — | — | — | 70.4 | |
| SRTBase Model=Olmo-3-7B-Instruct2026.04 | — | — | — | — | — | — | — | — | 68.4 |