Mathematical Reasoning on AIME 2025 (Pass@128)
80Pass@128DCPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DCPOBase Model=Qwen3-4B, Optimization Strategy=Distribution-Centric Policy Optimization2026.01 | 80 | |
| GRPOBase Model=Qwen3-4B, Optimization Strategy=Group Relative Policy Optimization2026.01 | 76.7 | |
| AEPOBase Model=Qwen3-4B, Optimization Strategy=AEPO2026.01 | 76.7 | |
| Entropy-RegBase Model=Qwen3-4B, Optimization Strategy=Entropy Regularization2026.01 | 73.3 | |
| Entropy-AdvBase Model=Qwen3-4B, Optimization Strategy=Entropy Advantage2026.01 | 73.3 | |
| Qwen3-4BOptimization Strategy=Base Model2026.01 | 63.3 |