Multi-task Generalization on Countdown and OOD Tasks Overall (test)
35.9AccuracyR1 Distill -> GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| R1 Distill -> GRPOtraining=SFT + GRPO2025.12 | 35.9 | |
| SkillFactory -> GRPOtraining=SFT + GRPO2025.12 | 35.7 | |
| BOLT -> GRPOtraining=SFT + GRPO2025.12 | 33 | |
| RL-Onlytraining=RL2025.12 | 31.9 | |
| R1 Distilltraining=SFT2025.12 | 30.3 | |
| STaR -> GRPOtraining=SFT + GRPO2025.12 | 30.2 | |
| Qwen2.5 1.5B Instructtraining=None2025.12 | 27.3 | |
| SkillFactorytraining=SFT2025.12 | 25.5 | |
| STaRtraining=SFT2025.12 | 20.4 | |
| BOLTtraining=SFT2025.12 | 16.2 |