Mathematical Reasoning on AIME (avg@16)
18.13Average Score (@16)GRPO-SG
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO-SGBase Model=Qwen2.5-7B, Training Recipe=DSR (DeepScaleR)2025.10 | 18.13 | |
| GRPO-SGBase Model=Qwen2.5-7B, Training Recipe=ORZ (Open Reasoner-Zero)2025.10 | 16.88 | |
| 80/20Base Model=Qwen2.5-7B, Training Recipe=ORZ (Open Reasoner-Zero)2025.10 | 16.4 | |
| GRPOBase Model=Qwen2.5-7B, Training Recipe=DSR (DeepScaleR)2025.10 | 15.63 | |
| ARBase Model=Qwen2.5-7B, Training Recipe=ORZ (Open Reasoner-Zero)2025.10 | 15.52 | |
| LoptiBase Model=Qwen2.5-7B, Training Recipe=DSR (DeepScaleR)2025.10 | 15.45 | |
| LoptiBase Model=Qwen2.5-7B, Training Recipe=ORZ (Open Reasoner-Zero)2025.10 | 15.27 | |
| 80/20Base Model=Qwen2.5-7B, Training Recipe=DSR (DeepScaleR)2025.10 | 14.94 | |
| GRPOBase Model=Qwen2.5-7B, Training Recipe=ORZ (Open Reasoner-Zero)2025.10 | 14.79 | |
| ARBase Model=Qwen2.5-7B, Training Recipe=DSR (DeepScaleR)2025.10 | 14.72 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.10 | 4.58 |