Mathematical Reasoning on OlympiadBench (Avg@4, Pass@4, avg)
60.8Avg@4 ScoreEAPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EAPOMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 60.8 | 69.5 | 57 | |
| KL-CovMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 59.9 | 69 | 56.5 | |
| ForkingMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 59.1 | 68.4 | 53.7 | |
| EntroAdvMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 59.1 | 68.9 | 56.3 | |
| GRPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 58.7 | 67.4 | 53.9 | |
| DAPOMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 58.4 | 67.1 | 55.1 | |
| EntroRegMethod Category=Policy Entropy Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 56.2 | 67 | 51.9 | |
| W-REINFMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 55.9 | 65.2 | 51.8 | |
| Base-1.5BMethod Category=Classic RLVR Method, Backbone=DeepScaleR-1.5B-8k2026.04 | 55.2 | 63.8 | 50.7 |