Mathematical Reasoning on AMC23 (Pass@1)
92.5Pass@1Critique-GRPO (CoT Critique)
Evaluation Results
| Method | Links | |
|---|---|---|
| Critique-GRPO (CoT Critique)Backbone=Qwen3-8B2025.06 | 92.5 | |
| MulFeRLBackbone=Qwen3-4B-Inst, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 90.3 | |
| Critique-GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 84.1 | |
| Dr.GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 79.1 | |
| GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 78.6 | |
| Critique-GRPOTraining Data Volume=4k, Critique Mode=CoT-Critique2025.06 | 70 | |
| Qwen3-8BBackbone=Qwen3-8B2025.06 | 67.5 | |
| SFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 62.6 | |
| Critique-GRPO (CoT Critique)Backbone=Qwen2.5-7B-Base2025.06 | 62.5 | |
| SetPO+DAPOBase Model=Qwen2.5-Math-7B, Optimization Algorithm=DAPO2026.02 | 62.3 | |
| CITL-FTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 62.1 | |
| RAFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 61.8 | |
| Oat-ZeroTraining Data Volume=46k2025.06 | 61.2 | |
| SetPO+GSPOBase Model=Qwen2.5-Math-7B, Optimization Algorithm=GSPO2026.02 | 60.9 | |
| SetPO+GRPOBase Model=Qwen2.5-Math-7B, Optimization Algorithm=GRPO2026.02 | 60.5 | |
| DAPOBase Model=Qwen2.5-Math-7B2026.02 | 59.6 | |
| s1.1-7BBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 59.5 | |
| Qwen3-4B-InstBackbone=Qwen3-4B-Inst, Training Strategy=Base Model2026.01 | 59.1 | |
| GSPOBase Model=Qwen2.5-Math-7B2026.02 | 57.7 | |
| SimpleRL-ZeroTraining Data Volume=46k2025.06 | 54.9 | |
| PRIME-ZeroTraining Data Volume=46k2025.06 | 54 | |
| GRPOBase Model=Qwen2.5-Math-7B2026.02 | 53.5 | |
| MulFeRLBackbone=Qwen2.5-7B-Base, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 50 | |
| LadderBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 47.5 | |
| Qwen2.5-Math-7B-BaseTraining Data Volume=None2025.06 | 47.5 | |
| RAFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 46.6 | |
| LadderBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 46 | |
| Critique-GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 45.7 | |
| Full SFTBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 45.3 | |
| QLoRABackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 45 | |
| GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 42.2 | |
| Qwen InstructBackbone=Qwen2.5-Math-1.5B, Pure SFT?=false2025.12 | 42 | |
| CITL-FTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 41.5 | |
| QLoRABackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 41.5 | |
| Qwen2.5-Math-7BModel Type=Base Model2026.02 | 41.3 | |
| Dr.GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 41.1 | |
| Qwen InstructBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 38.5 | |
| SFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 38.3 | |
| Qwen BaseBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 37.5 | |
| Full SFTBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 35.8 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base2025.06 | 35 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base, Training Strategy=Base Model2026.01 | 34.7 | |
| Qwen BaseBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 32.5 |