Mathematical Reasoning on AIME 2026 (avg@32)
59.1Average Success Rate (avg@32)CTPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CTPOBase Model=Qwen3-14B, Reasoning Setting=Tool-integrated2026.05 | 59.1 | |
| GSPOBase Model=Qwen3-14B, Reasoning Setting=Tool-integrated2026.05 | 56.1 | |
| CTPOBase Model=Qwen3-4B, Reasoning Setting=Tool-integrated2026.05 | 52.1 | |
| GRPOBase Model=Qwen3-14B, Reasoning Setting=Tool-integrated2026.05 | 49.8 | |
| GSPOBase Model=Qwen3-4B, Reasoning Setting=Tool-integrated2026.05 | 47.6 | |
| ConSPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 46.8 | |
| DisCOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 45.1 | |
| GRPOBase Model=Qwen3-4B, Reasoning Setting=Tool-integrated2026.05 | 44.1 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.9 | |
| Dr. GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 43.3 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 37.9 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.05 | 35.5 | |
| ConSPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 35.5 | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 34.2 | |
| DisCOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 32.8 | |
| Dr. GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 32.4 | |
| DAPOBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 29.9 | |
| ConSPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 23.9 | |
| GMPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 23.8 | |
| SAPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 23.3 | |
| CISPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 23 | |
| DisCOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 21.7 | |
| DAPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 20.8 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Llama-8B2026.05 | 20.6 | |
| GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 20.4 | |
| Dr. GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 19.5 | |
| Base ModelBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 13.9 | |
| BaseBase Model=Qwen3-14B, Reasoning Setting=Tool-integrated2026.05 | 6.9 | |
| BaseBase Model=Qwen3-4B, Reasoning Setting=Tool-integrated2026.05 | 3.4 |