Mathematical Reasoning on AIME 2024 (Pass@128)
86.7Pass@128DCPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DCPOBase Model=Qwen3-4B, Optimization Strategy=Distribution-Centric Policy Optimization2026.01 | 86.7 | |
| GRPOBase Model=Qwen3-4B, Optimization Strategy=Group Relative Policy Optimization2026.01 | 83.3 | |
| Entropy-RegBase Model=Qwen3-4B, Optimization Strategy=Entropy Regularization2026.01 | 83.3 | |
| Entropy-AdvBase Model=Qwen3-4B, Optimization Strategy=Entropy Advantage2026.01 | 83.3 | |
| AEPOBase Model=Qwen3-4B, Optimization Strategy=AEPO2026.01 | 83.3 | |
| Qwen3-4BOptimization Strategy=Base Model2026.01 | 76.7 |