Mathematical Reasoning on AMC 2023 (Accuracy and Tokens)
97.5AccuracyCoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoTBackbone=Qwen3-14B2025.09 | 97.5 | 5,669.67 | |
| CoT-SCBackbone=Qwen3-14B2025.09 | 97.5 | 17,032.82 | |
| RAGBackbone=Qwen3-14B2025.09 | 95 | 5,277.07 | |
| PieceHintBase model=DeepSeek-R1-Distill-7B2026.04 | 93.4 | — | |
| CoT-SCBackbone=Qwen3-4B2025.09 | 92.5 | 19,142.35 | |
| CoT-SCBackbone=Qwen3-8B2025.09 | 92.5 | 20,963.55 | |
| RoTBackbone=Qwen3-14B2025.09 | 92.5 | 6,114.88 | |
| CoTBackbone=Qwen3-4B2025.09 | 90 | 5,550.17 | |
| RAGBackbone=Qwen3-4B2025.09 | 90 | 6,240.79 | |
| RoT + TIBackbone=Qwen3-4B2025.09 | 90 | 5,052.9 | |
| CoTBackbone=Qwen3-8B2025.09 | 90 | 6,468.07 | |
| RoTBackbone=Qwen3-8B2025.09 | 90 | 6,522.53 | |
| GRPOBase model=DeepSeek-R1-Distill-7B2026.04 | 88.1 | — | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 88 | 3,109 | |
| RoTBackbone=Qwen3-4B2025.09 | 87.5 | 6,133.01 | |
| RAGBackbone=Qwen3-8B2025.09 | 87.5 | 6,960.72 | |
| RoT + TIBackbone=Qwen3-8B2025.09 | 87.5 | 5,780.75 | |
| GRPO + PR²Policy (Off-κ)=Off-2, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 87.5 | — | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 85.7 | 3,711 | |
| GRPO + PR²Policy (Off-κ)=Off-4, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 85.47 | — | |
| BoTBackbone=Qwen3-8B2025.09 | 85 | 40,784.82 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 84.9 | 4,338 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 84.2 | 7,381 | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 83.4 | 7,925 | |
| GRPO + PR²Policy (Off-κ)=Off-8, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 83.13 | — | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 83 | 5,281 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 82.8 | 7,501 | |
| RoT + TIBackbone=Qwen3-14B2025.09 | 82.5 | 5,191.57 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 82.2 | 5,194 | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 81.5 | 5,143 | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 80.3 | 4,601 | |
| CoTBackbone=Qwen3-1.7B2025.09 | 80 | 6,403.09 | |
| RAGBackbone=Qwen3-1.7B2025.09 | 80 | 6,842.54 | |
| CoT-SCBackbone=Qwen3-1.7B2025.09 | 80 | 25,292.25 | |
| BoTBackbone=Qwen3-4B2025.09 | 80 | 35,440.58 | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 79.6 | 5,709 | |
| GSPOPolicy (Off-κ)=Off-4, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 79.38 | — | |
| DeepSeek-R1-Distill-7BRole=backbone2026.04 | 78.8 | — | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 78.1 | 5,533 | |
| GRPO + R²Policy (Off-κ)=Off-2, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 77.5 | — | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 77.4 | 6,738 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-14B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 77.2 | 3,291 | |
| GSPOPolicy (Off-κ)=Off-2, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 77.18 | — | |
| GRPO + R²Policy (Off-κ)=Off-8, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 76.88 | — | |
| ICPO†Backbone=Qwen2.5-Math-7B2025.10 | 75.9 | — | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 75.7 | 5,478 | |
| ICPOBackbone=Qwen2.5-Math-7B2025.10 | 74.9 | — | |
| MERABackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 74.5 | 3,180 | |
| GRPOPolicy (Off-κ)=Off-2, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 74.06 | — | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 73.6 | 4,821 | |
| GRPO + R²Policy (Off-κ)=Off-4, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 73.59 | — | |
| GRPOPolicy (Off-κ)=Off-8, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 72.81 | — | |
| RoTBackbone=Qwen3-1.7B2025.09 | 72.5 | 8,478.95 | |
| FCS+Ref.Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 72.1 | 4,449 | |
| GSPOPolicy (Off-κ)=Off-8, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 72.03 | — | |
| GRPOPolicy (Off-κ)=Off-4, Base Model=Qwen3-30B-A3B-Base, Sampling Strategy=Avg@162026.05 | 70.93 | — | |
| ConSteer-RLBackbone=Qwen3-8B-Base2026.06 | 70.9 | — | |
| DASTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 70.2 | 5,583 | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 70.2 | 4,179 | |
| O1-PrunerBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 69.5 | 5,622 | |
| GRPOBackbone=Qwen3-8B-Base2026.06 | 69.2 | — | |
| No WaitBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 68.5 | 6,422 | |
| Prefix-RFT*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 68.2 | — | |
| OriginalBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 67.7 | 7,160 | |
| Uni-DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 67.5 | — | |
| SFTTraining Data=PC-83K, Base Model=Qwen2.5-7B-Instruct2025.08 | 67.5 | — | |
| ConSteer-RLBackbone=Qwen2.5-Math-7B2026.06 | 67.5 | — | |
| SFT+RL_GRPOBackbone=Qwen2.5-Math-7B2025.10 | 67.1 | — | |
| LUFFY*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 65.6 | — | |
| RL (PC-83K)Training Data=PC-83K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL (GRPO)2025.08 | 65 | — | |
| ReLIFT*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 64.8 | — | |
| LCPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Zero-shot Chain-of-Thought (CoT)=true2025.08 | 63.9 | 6,694 | |
| ConSteer-RLBackbone=Qwen3-4B-Base2026.06 | 63.8 | — | |
| RL_GRPOBackbone=Qwen2.5-Math-7B2025.10 | 63 | — | |
| GRPOBackbone=Qwen3-4B-Base2026.06 | 63 | — | |
| BoTBackbone=Qwen3-1.7B2025.09 | 62.5 | 50,371.8 | |
| RL (PC-SL-35K)Training Data=PC-SL-35K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL2025.08 | 62.5 | — | |
| SFTBackbone=Qwen2.5-Math-7B2025.10 | 61.8 | — | |
| Oat-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 61.2 | — | |
| RL (PC-83K+PC-SL-35K)Training Data=PC-83K + PC-SL-35K, Base Model=Qwen2.5-7B-Instruct, Training Method=RL2025.08 | 60 | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.06 | 60 | — | |
| RoT + TIBackbone=Qwen3-1.7B2025.09 | 57.5 | 5,955.47 | |
| Uni-DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 57.5 | — | |
| DPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 57.5 | — | |
| SimPOModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 57.5 | — | |
| SynLogic-7BBase Model=7B Parameters2025.08 | 55 | — | |
| SimpleRL-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 54.9 | — | |
| PRIME-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 54 | — | |
| BaselineModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 52.5 | — | |
| Qwen2.5-7B-InstructBase Model=Qwen2.5-7B-Instruct2025.08 | 52.5 | — | |
| OpenReasoner-Zero*Backbone=Qwen2.5-Math-7B, Reported from original paper=true2025.10 | 52.1 | — | |
| BaselineBackbone=Qwen3-8B-Base2026.06 | 51.7 | — | |
| DPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 47.5 | — | |
| SimPOModel=Qwen2.5-Math 1.5B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 47.5 | — | |
| BaselineModel=Qwen2.5-Math 7B, zero-shot chain-of-thought prompting=true, greedy decoding=true2025.06 | 47.5 | — | |
| CoTBackbone=Qwen3-0.6B2025.09 | 42.5 | 6,447.14 | |
| BaselineBackbone=Qwen3-4B-Base2026.06 | 41.6 | — | |
| RAGBackbone=Qwen3-0.6B2025.09 | 40 | 7,037.12 | |
| CoT-SCBackbone=Qwen3-0.6B2025.09 | 40 | 26,191.12 | |
| RoTBackbone=Qwen3-0.6B2025.09 | 35 | 7,388.15 |