Reinforcement Learning on Walker2d (Maximum evaluation return)
4,595.3Max ReturnSAC
Evaluation Results
| Method | Links | |
|---|---|---|
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 4,595.3 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 3,163.2 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,603.8 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,297.63 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 801.5 |