Reinforcement Learning on Reacher (Maximum Return)
6.48Maximum ReturnA2C
Evaluation Results
| Method | Links | |
|---|---|---|
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 6.48 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 5.43 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 3.15 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 2.67 | |
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 2.05 |