Mathematical Reasoning on AIME 24 (avg@12 Accuracy)
79.2Avg@12 AccuracyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPOModel=Qwen3-8B2026.05 | 79.2 | |
| OPSDModel=Qwen3-8B2026.05 | 79.2 | |
| SGSDModel=Qwen3-8B2026.05 | 78.9 | |
| Base+SkillModel=Qwen3-8B2026.05 | 78.3 | |
| GRPO+SkillModel=Qwen3-8B2026.05 | 78.3 | |
| OPSD+SkillModel=Qwen3-8B2026.05 | 77.8 | |
| GRPOModel=Qwen3-4B2026.05 | 76.1 | |
| OPSDModel=Qwen3-4B2026.05 | 75.3 | |
| OPSD+SkillModel=Qwen3-4B2026.05 | 75.3 | |
| SGSDModel=Qwen3-4B2026.05 | 75.3 | |
| BaseModel=Qwen3-8B2026.05 | 75.3 | |
| BaseModel=Qwen3-4B2026.05 | 73.9 | |
| GRPO+SkillModel=Qwen3-4B2026.05 | 73.9 | |
| Base+SkillModel=Qwen3-4B2026.05 | 71.9 | |
| SGSDModel=Qwen3-1.7B2026.05 | 57.8 | |
| OPSDModel=Qwen3-1.7B2026.05 | 55.8 | |
| OPSD+SkillModel=Qwen3-1.7B2026.05 | 54.4 | |
| GRPO+SkillModel=Qwen3-1.7B2026.05 | 52.2 | |
| BaseModel=Qwen3-1.7B2026.05 | 51.1 | |
| GRPOModel=Qwen3-1.7B2026.05 | 50 | |
| Base+SkillModel=Qwen3-1.7B2026.05 | 49.2 |