Reinforcement Learning on MountainCar (Random)
-45Avg Reward (gamma=0.01)MOREL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MORELData source (optimality)=Random, Algorithm variant=Planning2021.02 | -45 | -500 | -500 | |
| True env+MPCData source (optimality)=Oracle (True Environment)2021.02 | -53.95 | -182.9 | -197.5 | |
| PerSimData source (optimality)=Random2021.02 | -57.7 | -186.6 | -210.1 | |
| Vanilla CaDMData source (optimality)=Random2021.02 | -62.57 | -479.3 | -497.5 | |
| PE-TS CaDMData source (optimality)=Random2021.02 | -82 | -500 | -500 | |
| MORELData source (optimality)=Random, Algorithm variant=Acting2021.02 | -495 | -500 | -500 | |
| BCQData source (optimality)=Random, Algorithm variant=Planning2021.02 | -500 | -500 | -500 | |
| BCQData source (optimality)=Random, Algorithm variant=Acting2021.02 | -500 | -500 | -500 | |
| CQLData source (optimality)=Random, Algorithm variant=Planning2021.02 | -500 | -500 | -500 | |
| CQLData source (optimality)=Random, Algorithm variant=Acting2021.02 | -500 | -500 | -500 |