Math Reasoning on MATH500 (Accuracy)
95.6AccuracyCE-GPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 95.6 | |
| DAPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=DAPO2025.09 | 95.1 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 94.9 | |
| GRPOBase Model=DS-R1-Distill-Qwen-7B, Training Algorithm=GRPO2025.09 | 93.7 | |
| DS-R1-Distill-Qwen-7BBase Model=DS-R1-Distill-Qwen-7B2025.09 | 93.6 | |
| ReST-MCTSBackbone=Gemma-3-27B2025.11 | 93.2 | |
| ReST-MCTSBackbone=GPT-OSS-120B2025.11 | 91.6 | |
| APRMBackbone=GPT-OSS-120B2025.11 | 91.4 | |
| APRMBackbone=Gemma-3-27B2025.11 | 91.4 | |
| ReST-MCTSBackbone=GPT-OSS-20B2025.11 | 91 | |
| APRMBackbone=GPT-OSS-20B2025.11 | 91 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.5, Beta2 Hyperparameter=12025.09 | 91 | |
| CE-GPPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=CE-GPPO, Beta1 Hyperparameter=0.75, Beta2 Hyperparameter=12025.09 | 90.9 | |
| VRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=VRPO2025.08 | 90.2 | |
| rStar MathBackbone=GPT-OSS-120B2025.11 | 90 | |
| DAPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=DAPO2025.09 | 90 | |
| rStar MathBackbone=Gemma-3-27B2025.11 | 89.5 | |
| NL GuidanceBackbone=Qwen3-8B-Base2026.03 | 89.4 | |
| Reward ShapingBackbone=Qwen3-8B-Base2026.03 | 89.2 | |
| Ctrl-RBackbone=Qwen3-8B-Base, beta=0.22026.03 | 89.2 | |
| GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=GRPO2025.08 | 89.2 | |
| rStar MathBackbone=GPT-OSS-20B2025.11 | 89 | |
| Reinforce++Model Backbone=Qwen3-8B(Strong Model), Optimization Method=Reinforce++2025.08 | 89 | |
| DAPOBackbone=Qwen3-8B-Base2026.03 | 88.4 | |
| GRPOBase Model=DS-R1-Distill-Qwen-1.5B, Training Algorithm=GRPO2025.09 | 88.3 | |
| ToTBackbone=Gemma-3-27B2025.11 | 88 | |
| Dr.GRPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Dr.GRPO2025.08 | 87.8 | |
| ToTBackbone=GPT-OSS-120B2025.11 | 87.6 | |
| ToTBackbone=GPT-OSS-20B2025.11 | 87.6 | |
| BaseModel Backbone=Qwen3-8B(Strong Model), Optimization Method=Base2025.08 | 87.4 | |
| LLM-JBackbone=Gemma-3-27B2025.11 | 86.4 | |
| PPOModel Backbone=Qwen3-8B(Strong Model), Optimization Method=PPO2025.08 | 86.4 | |
| AutoPSVBackbone=GPT-OSS-120B2025.11 | 86 | |
| DS-R1-Distill-Qwen-1.5BBase Model=DS-R1-Distill-Qwen-1.5B2025.09 | 86 | |
| Math S.Backbone=GPT-OSS-120B2025.11 | 85.8 | |
| TaHModel Size=4B*2025.11 | 85.8 | |
| TaH+Model Size=4B*2025.11 | 85.6 | |
| LLM-JBackbone=GPT-OSS-120B2025.11 | 85.2 | |
| LLM-JBackbone=GPT-OSS-20B2025.11 | 85.2 | |
| Verify SbS.Backbone=GPT-OSS-120B2025.11 | 85 | |
| SoftThinkModel Size=4B*2025.11 | 85 | |
| CoT-SCBackbone=GPT-OSS-120B2025.11 | 84.4 | |
| StandardModel Size=4B*2025.11 | 84.2 | |
| AutoPSVBackbone=GPT-OSS-20B2025.11 | 84 | |
| OuroModel Size=4B*2025.11 | 83.8 | |
| AutoPSVBackbone=Gemma-3-27B2025.11 | 83 | |
| Math S.Backbone=GPT-OSS-20B2025.11 | 82 | |
| Math S.Backbone=Gemma-3-27B2025.11 | 81.5 | |
| ReST-MCTSBackbone=Gemma-3-12B2025.11 | 81.4 | |
| Verify SbS.Backbone=GPT-OSS-20B2025.11 | 80 | |
| Verify SbS.Backbone=Gemma-3-27B2025.11 | 80 | |
| APRMBackbone=Gemma-3-12B2025.11 | 80 | |
| CGDTeacher Model=S1.1-32B2025.05 | 79.6 | |
| CGDTeacher Model=Claude Sonnet 3.72025.05 | 79.4 | |
| CFTTeacher Model=GPT-4o2025.05 | 79.2 | |
| rStar MathBackbone=Gemma-3-12B2025.11 | 79 | |
| CoT-SCBackbone=Gemma-3-27B2025.11 | 78.8 | |
| Math S.Backbone=Gemma-3-12B2025.11 | 78.5 | |
| CoT-SCBackbone=GPT-OSS-20B2025.11 | 78 | |
| AutoPSVBackbone=Gemma-3-12B2025.11 | 78 | |
| ToTBackbone=Gemma-3-12B2025.11 | 77.6 | |
| Verify SbS.Backbone=Gemma-3-12B2025.11 | 77.5 | |
| CoT-SCBackbone=Gemma-3-12B2025.11 | 76.8 | |
| Dr.GRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Dr.GRPO2025.08 | 73 | |
| LLM-JBackbone=Gemma-3-12B2025.11 | 72.8 | |
| TaH+Model Size=1.7B2025.11 | 72.6 | |
| VRPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=VRPO2025.08 | 72.2 | |
| CFTTeacher Model=S1.1-32B2025.05 | 71.6 | |
| BaseModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Base2025.08 | 71.6 | |
| TaHModel Size=1.7B2025.11 | 71.4 | |
| Ctrl-RBackbone=Qwen3-1.7B-Base, beta=0.22026.03 | 71 | |
| Ctrl-RBackbone=Qwen3-1.7B-Base, beta=0, Importance Sampling (IS)=false2026.03 | 69.6 | |
| Ctrl-RBackbone=Qwen3-1.7B-Base, beta=1, Importance Sampling (IS)=true2026.03 | 69.6 | |
| NL GuidanceBackbone=Qwen3-1.7B-Base2026.03 | 69 | |
| Reward ShapingBackbone=Qwen3-1.7B-Base2026.03 | 69 | |
| DAPOBackbone=Qwen3-1.7B-Base2026.03 | 68.4 | |
| OuroModel Size=1.7B2025.11 | 68.2 | |
| StandardModel Size=1.7B2025.11 | 67.8 | |
| PPOModel Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=PPO2025.08 | 67.4 | |
| SoftThinkModel Size=1.7B2025.11 | 64.8 | |
| Reinforce++Model Backbone=Qwen2.5-7B-Cold Start(Weak Model), Optimization Method=Reinforce++2025.08 | 63.8 | |
| AlwaysThinkModel Size=1.7B2025.11 | 63.2 | |
| ICLBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 58.4 | |
| BaseBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Base2026.06 | 58.2 | |
| PolicyAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 58.2 | |
| IndividualModel Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 57.65 | |
| NSPOBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 57.4 | |
| DARE w/ HARCMerging Strategy=DARE, Model Architecture=Qwen3-30B-A3B, HARC Calibration=true2026.06 | 57.35 | |
| GRPO+PolicyBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 57.2 | |
| TIES-Merging w/ HARCMerging Strategy=TIES-Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=true2026.06 | 56.98 | |
| Fisher Merging w/ HARCMerging Strategy=Fisher Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=true2026.06 | 56.94 | |
| Weight AveragingMerging Strategy=Weight Averaging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 56.78 | |
| DAREMerging Strategy=DARE, Model Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 56.45 | |
| Weight Averaging w/ HARCMerging Strategy=Weight Averaging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=true2026.06 | 56.23 | |
| WUDI-Merging w/ HARCMerging Strategy=WUDI-Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=true2026.06 | 56.19 | |
| TIES-MergingMerging Strategy=TIES-Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 56.14 | |
| Qwen2.5-Math-7B (Base)2025.05 | 55.4 | |
| Fisher MergingMerging Strategy=Fisher Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 55.38 | |
| WUDI-MergingMerging Strategy=WUDI-Merging, Model Architecture=Qwen3-30B-A3B, HARC Calibration=false2026.06 | 55.18 | |
| AlphaAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 54.4 |