Mathematical Reasoning on AIME 2024 (Pass@32 and Avg@32)
45.1Average Score (Avg@32)EAPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EAPOMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 45.1 | 74.6 | 57 | |
| EntroAdvMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 44 | 73.9 | 56.3 | |
| KL-CovMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 43.9 | 71.8 | 56.5 | |
| DAPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 40.9 | 75.6 | 55.1 | |
| GRPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 38.1 | 64.8 | 53.9 | |
| ForkingMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 38.1 | 71.7 | 53.7 | |
| W-REINFMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 35 | 66.1 | 51.8 | |
| EntroRegMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 34.6 | 70.4 | 51.9 | |
| Base-1.5BMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 32.5 | 71.6 | 50.7 |