Planning and Puzzle Solving on Sokoban
62.5AccuracySkill-SD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Skill-SDModel Backbone=Qwen3-4B-Instruct-25072026.04 | 62.5 | 71.1 | |
| Vanilla GRPOModel Backbone=Qwen3-4B-Instruct-25072026.04 | 51.6 | 68.8 | |
| Vanilla OPDModel Backbone=Qwen3-4B-Instruct-25072026.04 | 21.9 | 37.5 | |
| Skill-Augmented GRPOModel Backbone=Qwen3-4B-Instruct-25072026.04 | 20.3 | 37.5 | |
| Base ModelModel Backbone=Qwen3-4B-Instruct-25072026.04 | 12.5 | 32 |