Reinforcement Learning on Cheetah-Gravity (OpenAI Gym Mujoco, train)
226.72Average RewardVBLRL
Evaluation Results
| Method | Links | |
|---|---|---|
| VBLRLsamples per iteration=1x2022.10 | 226.72 | |
| T-HiP-MDPsamples per iteration=1x2022.10 | 170.2 | |
| LPG-FTWsamples per iteration=2x2022.10 | -29.49 | |
| Single-task MBRLmode=train from scratch2022.10 | -40.47 | |
| EWCsamples per iteration=2x2022.10 | -3,440.66 |