Multi-turn RL Task Completion on FrozenLake
30Success RateQwen2.5-0.5B (TSR Beam Search)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-0.5B (TSR Beam Search)Model=Qwen2.5-0.5B, Training Strategy=TSR Beam Search2026.02 | 30 | |
| Qwen2.5-0.5B (TSR Lookahead)Model=Qwen2.5-0.5B, Training Strategy=TSR Lookahead2026.02 | 27.8 | |
| GPT-4oProtocol=zero-shot2026.02 | 26.56 | |
| Qwen2.5-0.5B (TSR Best-of-N)Model=Qwen2.5-0.5B, Training Strategy=TSR Best-of-N2026.02 | 25 | |
| Qwen2.5-72BProtocol=zero-shot2026.02 | 23.83 | |
| Qwen2.5-0.5B (Instance Filtering)Model=Qwen2.5-0.5B, Training Strategy=Instance Filtering2026.02 | 19.7 |