Reinforcement Learning on MiniGrid UnlockPickup
24.3Success RateLLM Iterative
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM IterativeTraining Episodes=3,0002026.05 | 24.3 | |
| Hand-CraftedTraining Episodes=3,0002026.05 | 18.9 | |
| LLM One-ShotTraining Episodes=3,0002026.05 | 15.8 | |
| No ShapingTraining Episodes=3,0002026.05 | 0.1 | |
| RNDTraining Episodes=3,0002026.05 | 0 |