Arithmetic Reasoning on Long Multiplication 2,3,4,5-digit (OOD)
37.1AccuracyR1 Distill -> GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| R1 Distill -> GRPOtraining=SFT + GRPO2025.12 | 37.1 | |
| SkillFactory -> GRPOtraining=SFT + GRPO2025.12 | 35 | |
| R1 Distilltraining=SFT2025.12 | 32.4 | |
| SkillFactorytraining=SFT2025.12 | 32.4 | |
| Qwen2.5 1.5B Instructtraining=None2025.12 | 29.8 | |
| BOLT -> GRPOtraining=SFT + GRPO2025.12 | 26.6 | |
| RL-Onlytraining=RL2025.12 | 24.4 | |
| STaR -> GRPOtraining=SFT + GRPO2025.12 | 23.2 | |
| STaRtraining=SFT2025.12 | 22.1 | |
| BOLTtraining=SFT2025.12 | 15.1 |