Mathematical Reasoning on AIME 24 (ACC, LEN)
79.17AccuracyCOPT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| COPTBackbone=Qwen3-8B, Reasoning Effort=High (Peak Accuracy)2026.05 | 79.17 | 11,525 | — | |
| CoTBackbone=Qwen3-8B2026.05 | 75.83 | 12,077 | — | |
| CoT (Greedy)Backbone=Qwen3-8B2026.05 | 70 | 11,680 | — | |
| SWA8k-RL-1200Training Stage=RL, RL Steps=1200, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=8k, T_Train=466, T_Eval=2.232026.06 | 60.3 | — | — | |
| SWA4k-RL-1400Training Stage=RL, RL Steps=1400, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=4k, T_Train=474, T_Eval=1.872026.06 | 57.5 | — | — | |
| SA-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Standard Attention, T_Train=498, T_Eval=2.812026.06 | 56.6 | — | — | |
| SWA8k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=8k, T_Train=337, T_Eval=2.112026.06 | 56.6 | — | — | |
| SWA4k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=4k, T_Train=285, T_Eval=1.842026.06 | 53 | — | — | |
| SWA2k-RL-1700Training Stage=RL, RL Steps=1700, RL Training Budget=~500 GPU Hours, Attention Architecture=Sliding Window Attention, Sliding Window Size=2k, T_Train=470, T_Eval=1.332026.06 | 52.4 | — | — | |
| SWA2k-RL-900Training Stage=RL, RL Steps=900, Attention Architecture=Sliding Window Attention, Sliding Window Size=2k, T_Train=225, T_Eval=1.462026.06 | 46.8 | — | — | |
| Qwen3-14B + GRPOBackbone=Qwen3-14B, Training=GRPO2026.05 | 46.5 | — | 6,362 | |
| Qwen3-14B + SLATBackbone=Qwen3-14B, Training=SLAT2026.05 | 45 | — | 4,198 | |
| SFPOModel=DS-Qwen-7B2025.10 | 43.75 | — | — | |
| GRPOModel=DS-Qwen-7B2025.10 | 42.5 | — | — | |
| SA-SFTTraining Stage=SFT, Attention Architecture=Standard Attention, T_Train=615, T_Eval=10.442026.06 | 40.1 | — | — | |
| SWA8k-SFTTraining Stage=SFT, Attention Architecture=Sliding Window Attention, Sliding Window Size=8k, T_Train=560, T_Eval=5.542026.06 | 34.2 | — | — | |
| SFPOModel=DS-Qwen-1.5B2025.10 | 34.17 | — | — | |
| GRPOModel=DS-Qwen-1.5B2025.10 | 32.92 | — | — | |
| Qwen3-14BBackbone=Qwen3-14B2026.05 | 28.8 | — | 1,641 | |
| LRSModel=OPEN-REASONER-7B, Prompting=0-shot2026.05 | 26.6 | — | — | |
| BaseModel=DS-Qwen-7B2025.10 | 25.42 | — | — | |
| ReSumBackbone=Qwen2.5-Math-7B2026.06 | 25.42 | — | — | |
| DGPOBackbone=Qwen2.5-Math-7B2026.06 | 23.85 | — | — | |
| SWA4k-SFTTraining Stage=SFT, Attention Architecture=Sliding Window Attention, Sliding Window Size=4k, T_Train=528, T_Eval=4.702026.06 | 22.4 | — | — | |
| GPGBackbone=Qwen2.5-Math-7B2026.06 | 21.98 | — | — | |
| GRPO-ADBackbone=Qwen2.5-Math-7B2026.06 | 21.56 | — | — | |
| DAPOBackbone=Qwen2.5-Math-7B2026.06 | 21.25 | — | — | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B2026.06 | 21.04 | — | — | |
| GRPOBackbone=Qwen2.5-Math-7B2026.06 | 20.94 | — | — | |
| BaseModel=DS-Qwen-1.5B2025.10 | 20.4 | — | — | |
| GSPOBackbone=Qwen2.5-Math-7B2026.06 | 19.38 | — | — | |
| ReLIFTBackbone=Qwen2.5-7B2025.06 | 19.1 | 5,522 | — | |
| STEERBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 17.4 | — | — | |
| BaseModel=OPEN-REASONER-7B, Prompting=0-shot2026.05 | 16.6 | — | — | |
| LRS BASICModel=OPEN-REASONER-7B, Prompting=0-shot2026.05 | 16.6 | — | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 16.2 | — | — | |
| ReSumBackbone=Qwen2.5-Math-1.5B2026.06 | 15.96 | — | — | |
| SFTBackbone=Qwen2.5-7B2025.06 | 15.7 | 7,786 | — | |
| RLBackbone=Qwen2.5-7B2025.06 | 15.5 | 1,784 | — | |
| Entro. Adv.Backbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 15 | — | — | |
| OPOBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 14.8 | — | — | |
| Clip-CovBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 14.7 | — | — | |
| ReLIFTBackbone=Qwen2.5-Math-1.5B2025.06 | 14.3 | 3,691 | — | |
| SWA2k-SFTTraining Stage=SFT, Attention Architecture=Sliding Window Attention, Sliding Window Size=2k, T_Train=507, T_Eval=4.202026.06 | 13.8 | — | — | |
| CoTModel=OPEN-REASONER-7B2026.05 | 13.3 | — | — | |
| few-shotModel=OPEN-REASONER-7B2026.05 | 13.3 | — | — | |
| LRSModel=OPEN-REASONER-1.5B, Prompting=0-shot2026.05 | 13.3 | — | — | |
| SFTBackbone=Qwen2.5-Math-1.5B2025.06 | 12.7 | 7,925 | — | |
| Base ModelBackbone=Qwen2.5-Math-7B2026.06 | 12.19 | — | — | |
| Qwen-7B-InstructBackbone=Qwen2.5-7B2025.06 | 11.5 | 1,939 | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.06 | 11.35 | — | — | |
| DGPOBackbone=Qwen2.5-Math-1.5B2026.06 | 11.25 | — | — | |
| Qwen-Math-1.5B-InstructBackbone=Qwen2.5-Math-1.5B2025.06 | 10.3 | 4,042 | — | |
| BaseBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 10 | — | — | |
| VRPOBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 10 | — | — | |
| RLBackbone=Qwen2.5-Math-1.5B2025.06 | 9.8 | 2,425 | — | |
| ReSumBackbone=Qwen2.5-3B2026.06 | 7.5 | — | — | |
| DGPOBackbone=Qwen2.5-3B2026.06 | 6.98 | — | — | |
| Base ModelBackbone=Qwen2.5-Math-1.5B2026.06 | 6.87 | — | — | |
| CoTModel=OPEN-REASONER-1.5B2026.05 | 6.7 | — | — | |
| few-shotModel=OPEN-REASONER-1.5B2026.05 | 6.7 | — | — | |
| PPOBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 6.67 | — | — | |
| Qwen-7BBackbone=Qwen2.5-7B2025.06 | 6.2 | 1,632 | — | |
| LLaMa-8B-InstructBackbone=LLaMA-3.1-8B2025.06 | 5.6 | 1,396 | — | |
| GRPOBackbone=Qwen2.5-3B2026.06 | 5.31 | — | — | |
| BaseBackbone=Qwen2.5-Math-1.5B, Sampling Strategy=avg@322025.10 | 4.1 | — | — | |
| GRPOBase Model=LLaMA 3.1-8B-Instruct, Optimization Setting=Training-time optimization, Reward Supervision=Noisy rule-based2025.08 | 3.33 | — | — | |
| BaseModel=OPEN-REASONER-1.5B, Prompting=0-shot2026.05 | 3.3 | — | — | |
| Base ModelBackbone=Qwen2.5-3B2026.06 | 2.81 | — | — | |
| Qwen-Math-1.5BBackbone=Qwen2.5-Math-1.5B2025.06 | 2.8 | 1,971 | — | |
| DGPOBackbone=DeepSeek-Math-7B2026.06 | 1.98 | — | — | |
| RLBackbone=LLaMA-3.1-8B2025.06 | 1.8 | 940 | — | |
| ReSumBackbone=DeepSeek-Math-7B2026.06 | 1.66 | — | — | |
| ReLIFTBackbone=LLaMA-3.1-8B2025.06 | 1.3 | 1,236 | — | |
| SFTBackbone=LLaMA-3.1-8B2025.06 | 0.8 | 2,033 | — | |
| GRPOBackbone=DeepSeek-Math-7B2026.06 | 0.63 | — | — | |
| Base ModelBackbone=DeepSeek-Math-7B2026.06 | 0.42 | — | — | |
| LRS BASICModel=OPEN-REASONER-1.5B, Prompting=0-shot2026.05 | 0 | — | — |