Reinforcement Learning on MuJoCo Hopper v4
549Policy ReturnRND
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RNDTraining Episodes=1,0002026.05 | 549 | — | |
| LLM One-ShotTraining Episodes=1,0002026.05 | 485 | — | |
| LLM IterativeTraining Episodes=1,000, Refinement Type=return-aware refinement, n=62026.05 | 472 | — | |
| Hand-CraftedTraining Episodes=1,0002026.05 | 462 | — | |
| No ShapingTraining Episodes=1,0002026.05 | 453 | — |