Reinforcement Learning on Reacher v4
-4Avg Episodic RewardPDA
Evaluation Results
| Method | Links | |
|---|---|---|
| PDAEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | -4 | |
| NPGEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | -5.7 | |
| TRPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | -6.1 | |
| PPOEnvironment steps=1M, Number of seeds=10, Tests per epoch=102026.03 | -18.7 |