Mathematical Reasoning on Reasoning Benchmarks Average
44.7Average AccuracyEEPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EEPOBase Model=Qwen3-14B-Base2025.10 | 44.7 | — | |
| GRPOBase Model=Qwen3-14B-Base2025.10 | 40.6 | — | |
| Qwen3-235B-A22b-InstructModel=Qwen3-235B-A22b-Instruct2026.05 | 35.79 | 38.4 | |
| EP-GRPOBackbone=Qwen2.5-7B2026.05 | 30.34 | 97.33 | |
| GRPOBackbone=Qwen2.5-7B2026.05 | 27.11 | 96.98 | |
| DeepSeek-R1-671B-0528Model=DeepSeek-R1-671B-05282026.05 | 23.39 | 30.23 | |
| EP-GRPOBackbone=Qwen2.5-3B2026.05 | 22.93 | 95.75 | |
| GRPO (More Rollouts)Backbone=Qwen2.5-3B, Rollouts (G)=102026.05 | 19.13 | 96.79 | |
| GRPO (Higher Temp)Backbone=Qwen2.5-3B, Sampling Temperature=1.22026.05 | 18.92 | 96.3 | |
| GRPOBackbone=Qwen2.5-3B, Citation=[28]2026.05 | 18.14 | 96.23 | |
| Qwen2.5-7B BaseBackbone=Qwen2.5-7B2026.05 | 12.23 | 80.78 | |
| Qwen2.5-3B BaseBackbone=Qwen2.5-3B2026.05 | 10.71 | 74.56 |