Reinforcement Learning on BipedalWalker v3
273.2ReturnPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 273.2 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 212.3 | |
| POEMEvaluation Episodes=152026.01 | 180.58 | |
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 149 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 106.3 | |
| PPOEvaluation Episodes=152026.01 | 62.43 |