Reinforcement Learning on Inverted Pendulum
1,000Maximum Evaluation ReturnPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,000 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,000 | |
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,000 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,000 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,000 |