Reinforcement Learning on MiniGrid LavaGap-S5
88.8Success RateLLM Iterative
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM IterativeTraining Episodes=3,000, Evaluation Window=last 100 episodes, Random Seeds=10, Refinement Type=standard diagnostic refinement2026.05 | 88.8 | |
| RNDTraining Episodes=3,000, Evaluation Window=last 100 episodes, Random Seeds=10, Coefficient c=0.12026.05 | 85.5 | |
| No ShapingTraining Episodes=3,000, Evaluation Window=last 100 episodes, Random Seeds=102026.05 | 64.4 | |
| LLM One-ShotTraining Episodes=3,000, Evaluation Window=last 100 episodes, Random Seeds=102026.05 | 64.3 | |
| Hand-CraftedTraining Episodes=3,000, Evaluation Window=last 100 episodes, Random Seeds=102026.05 | 63.6 |