Reinforcement Learning on CartPole Pure-8-40
200Average Reward (EpLen=2, DF=0.5)True env+MPC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| True env+MPCData source (optimality)=Oracle (True Environment)2021.02 | 200 | 198.4 | 200 | |
| PerSimData source (optimality)=Pure-8-402021.02 | 199.9 | 198 | 197.4 | |
| CQLData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 182.2 | 198.3 | 191.9 | |
| MORELData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 178.9 | 197.9 | 190.6 | |
| Vanilla CaDMData source (optimality)=Pure-8-402021.02 | 160.6 | 191.9 | 79.6 | |
| PE-TS CaDMData source (optimality)=Pure-8-402021.02 | 91.9 | 197 | 143.5 | |
| BCQData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | 34.6 | 47.71 | 23.2 | |
| BCQData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 28.9 | 31.8 | 18.5 | |
| CQLData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | 20.7 | 134.2 | 9.7 | |
| MORELData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | 20.7 | 135.4 | 10.8 |