Reinforcement Learning on MuJoCo HalfCheetah v4
2,287ReturnHand-Crafted
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Hand-CraftedTraining Episodes=1,000, Random Seeds=102026.05 | 2,287 | — | |
| LLM IterativeTraining Episodes=1,000, Random Seeds=6, Refinement Type=return-aware refinement, n=62026.05 | 2,215 | — | |
| LLM One-ShotTraining Episodes=1,000, Random Seeds=102026.05 | 2,190 | — | |
| No ShapingTraining Episodes=1,000, Random Seeds=102026.05 | 1,864 | — | |
| RNDTraining Episodes=1,000, Random Seeds=102026.05 | 1,580 | — |