Reinforcement Learning on InvertedDoublePendulum v4
9,167.5Average Episodic RewardPDA
Evaluation Results
| Method | Links | |
|---|---|---|
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 9,167.5 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 7,967.2 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 7,926.8 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | 2,723.4 |