Mathematical Reasoning on AIME-25 (Mean Accuracy)
52.3Mean AccuracySkyWork-OR1-Math-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SkyWork-OR1-Math-7BTeacher Model=SkyWork-OR1-Math-7B2026.03 | 52.3 | — | |
| SkyWork-OR1-7BTeacher Model=SkyWork-OR1-7B2026.03 | 49.7 | — | |
| REOPOLDTeacher Model=SkyWork-OR1-Math-7B, Method=REOPOLD2026.03 | 32.6 | — | |
| RKLTeacher Model=SkyWork-OR1-Math-7B, Method=RKL2026.03 | 30.6 | — | |
| REOPOLDTeacher Model=SkyWork-OR1-7B, Method=REOPOLD2026.03 | 26.7 | — | |
| SFTTeacher Model=SkyWork-OR1-Math-7B, Method=SFT2026.03 | 24.6 | — | |
| RKLTeacher Model=SkyWork-OR1-7B, Method=RKL2026.03 | 23.9 | — | |
| GRPOTeacher Model=SkyWork-OR1-Math-7B, Method=GRPO2026.03 | 23.7 | — | |
| R1-Distill-Qwen-1.5BStudent Model=DeepSeek-R1-Distill-Qwen-1.5B2026.03 | 22.7 | — | |
| SFTBackbone=Qwen2.5-7B2025.06 | 18.6 | 7,533 | |
| ReLIFTBackbone=Qwen2.5-7B2025.06 | 14.7 | 4,831 | |
| SFTBackbone=Qwen2.5-Math-1.5B2025.06 | 13 | 7,719 | |
| RLBackbone=Qwen2.5-7B2025.06 | 13 | 1,487 | |
| PSFTTraining Protocol=PSFT2025.08 | 10.73 | — | |
| SFTTraining Protocol=SFT2025.08 | 10.21 | — | |
| ReLIFTBackbone=Qwen2.5-Math-1.5B2025.06 | 10 | 3,416 | |
| RLBackbone=Qwen2.5-Math-1.5B2025.06 | 8.5 | 2,195 | |
| Qwen-Math-1.5B-InstructBackbone=Qwen2.5-Math-1.5B2025.06 | 7.6 | 3,764 | |
| Qwen-7B-InstructBackbone=Qwen2.5-7B2025.06 | 6.1 | 1,500 | |
| Qwen-7BBackbone=Qwen2.5-7B2025.06 | 2.4 | 1,370 | |
| BaseTraining Protocol=Base2025.08 | 1.88 | — | |
| SFTBackbone=LLaMA-3.1-8B2025.06 | 1.5 | 2,032 | |
| Qwen-Math-1.5BBackbone=Qwen2.5-Math-1.5B2025.06 | 1.3 | 2,058 | |
| LLaMa-8B-InstructBackbone=LLaMA-3.1-8B2025.06 | 0.7 | 1,401 | |
| ReLIFTBackbone=LLaMA-3.1-8B2025.06 | 0.2 | 1,272 | |
| RLBackbone=LLaMA-3.1-8B2025.06 | 0 | 909 |