Mathematical Reasoning on AIME 2025 (Avg@32, Pass@32)
17.2Average Score (Avg@32)EAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EAPOBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 17.2 | 37.6 | |
| DAPOBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 17.1 | 40.8 | |
| EntroAdvBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 16.3 | 35.7 | |
| ForkingBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 15.1 | 36.1 | |
| KL-CovBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 13.8 | 33.6 | |
| EntroRegBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 12.6 | 28.5 | |
| W-REINFBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 10.1 | 34 | |
| GRPOBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 9.3 | 25.2 | |
| PRIMEBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 6.1 | 26.3 | |
| Base-7BBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 5.1 | 23.5 |