Mathematical Reasoning on AIME 25 (Pass@1, Pass@16)
26.7Pass@1APMPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| APMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 26.7 | 50 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 23.3 | 50 | |
| GMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 23.3 | 46.7 | |
| GMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 20 | 26.7 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 20 | 43.3 | |
| DAPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 16.7 | 23.3 | |
| APMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 16.7 | 26.7 | |
| GRPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 13.3 | 16.7 | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 13.3 | 40 | |
| DAPOBackbone=Qwen2.5-3B-Instruct2026.04 | 10 | 20 | |
| GMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 10 | 16.7 | |
| APMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 10 | 20 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.04 | 6.7 | 13.3 | |
| BaseBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 3.3 | 10 | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.04 | 0 | 6.7 |