Multi-turn RL Task Completion on Sokoban
38.3Success RateQwen2.5-0.5B (TSR Beam Search)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-0.5B (TSR Beam Search)Model=Qwen2.5-0.5B, Training Strategy=TSR Beam Search2026.02 | 38.3 | |
| Qwen2.5-0.5B (TSR Lookahead)Model=Qwen2.5-0.5B, Training Strategy=TSR Lookahead2026.02 | 36.1 | |
| Qwen2.5-0.5B (TSR Best-of-N)Model=Qwen2.5-0.5B, Training Strategy=TSR Best-of-N2026.02 | 33.3 | |
| Qwen2.5-0.5B (Instance Filtering)Model=Qwen2.5-0.5B, Training Strategy=Instance Filtering2026.02 | 29 | |
| GPT-4oProtocol=zero-shot2026.02 | 27.73 | |
| Qwen2.5-72BProtocol=zero-shot2026.02 | 19.53 |