Mathematical Reasoning on AIME 24/25/26 (val)
54.79Avg@16 AccuracyCPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| CPPOBackbone=Qwen3-30B-A3B-Base2026.06 | 54.79 | |
| DPPOBackbone=Qwen3-30B-A3B-Base2026.06 | 49.23 | |
| TRM-AvgBackbone=Qwen3-30B-A3B-Base2026.06 | 48.96 | |
| MinPROBackbone=Qwen3-30B-A3B-Base2026.06 | 48.12 | |
| GRPOBackbone=Qwen3-30B-A3B-Base2026.06 | 38.19 | |
| CPPOBackbone=Qwen3-1.7B2026.06 | 31.88 | |
| CPPOBackbone=Qwen3-8B-Base2026.06 | 31.11 | |
| MinPROBackbone=Qwen3-8B-Base2026.06 | 29.72 | |
| CISPOBackbone=Qwen3-8B-Base2026.06 | 29.58 | |
| DPPOBackbone=Qwen3-8B-Base2026.06 | 28.89 | |
| CISPOBackbone=Qwen3-1.7B2026.06 | 28.82 | |
| DPPOBackbone=Qwen3-1.7B2026.06 | 28.19 | |
| TRM-AvgBackbone=Qwen3-8B-Base2026.06 | 27.98 | |
| GRPOBackbone=Qwen3-1.7B2026.06 | 27.91 | |
| MinPROBackbone=Qwen3-1.7B2026.06 | 27.71 | |
| TRM-AvgBackbone=Qwen3-1.7B2026.06 | 26.87 | |
| TRM-MaxBackbone=Qwen3-8B-Base2026.06 | 26.73 | |
| TRM-MaxBackbone=Qwen3-1.7B2026.06 | 25.21 | |
| GRPOBackbone=Qwen3-8B-Base2026.06 | 23.96 | |
| TRM-MaxBackbone=Qwen3-30B-A3B-Base2026.06 | 20.27 | |
| CPPOBackbone=Qwen3-1.7B-Base2026.06 | 12.78 | |
| CISPOBackbone=Qwen3-1.7B-Base2026.06 | 11.87 | |
| TRM-AvgBackbone=Qwen3-1.7B-Base2026.06 | 11.7 | |
| MinPROBackbone=Qwen3-1.7B-Base2026.06 | 11.04 | |
| DPPOBackbone=Qwen3-1.7B-Base2026.06 | 10.9 | |
| TRM-MaxBackbone=Qwen3-1.7B-Base2026.06 | 9.72 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.06 | 8.89 |