Mathematical Reasoning on AMC23, AIME24, MATH500
85.83Acc (AMC23)ESPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ESPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.05 | 85.83 | 46.28 | 87.42 | 73.17 | 839.24 | 3,278.3 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.05 | 83.76 | 45.57 | 85.95 | 71.76 | 1,035.01 | 4,043 | |
| PPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.05 | 82.94 | 45.25 | 85.43 | 71.2 | 1,072.4 | 4,189.06 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=7B2026.05 | 78.64 | 40.13 | 83.36 | 62.04 | — | 5,357 | |
| ESPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.05 | 71.87 | 23.87 | 81.53 | 59.09 | 927.96 | 3,624.86 | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.05 | 70.23 | 24.37 | 80.28 | 58.29 | 1,223.96 | 4,781.09 | |
| PPOBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.05 | 68.43 | 23.02 | 79.65 | 57.03 | 1,069.66 | 4,178.37 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen, Model Scale=1.5B2026.05 | 58.28 | 20.31 | 74.81 | 51.13 | — | 5,808 |