Reinforcement Learning on Cart-Pole OpenAI Gym (3 held-out domains (variable pole length and cart mass))
170.81ReturnRL-MLDG
Evaluation Results
| Method | Links | |
|---|---|---|
| RL-MLDGalgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 170.81 | |
| RL-MLDG-GNalgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 164.97 | |
| RL-Undobiasalgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 150.46 | |
| RL-MLDG-GCalgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 147.76 | |
| RL-Allalgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 144.21 | |
| RL-Random-Sourcealgorithm=REINFORCE, policy_architecture=1-hidden layer neural network (50 units)2017.10 | 98.22 |