Reinforcement Learning on HalfCheetah Pure-8-20
7,459Average Reward (0.3/1.7)True env+MPC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| True env+MPCData source (optimality)=Oracle (True Environment)2021.02 | 7,459 | 42,893 | 66,675 | |
| PerSimData source (optimality)=Pure-8-202021.02 | 3,186 | 1,032 | 1,121 | |
| PE-TS CaDMData source (optimality)=Pure-8-202021.02 | 1,082 | 1,125 | 1,067 | |
| CQLData source (optimality)=Pure-8-20, Algorithm variant=Planning2021.02 | 838.7 | 3,155 | 539.9 | |
| Vanilla CaDMData source (optimality)=Pure-8-202021.02 | 412 | 31.92 | 460.2 | |
| BCQData source (optimality)=Pure-8-20, Algorithm variant=Acting2021.02 | 376.8 | 84.66 | 230.1 | |
| BCQData source (optimality)=Pure-8-20, Algorithm variant=Planning2021.02 | 254.6 | 406.7 | 385.9 | |
| MORELData source (optimality)=Pure-8-20, Algorithm variant=Planning2021.02 | 0.6 | -171.2 | -219.9 | |
| CQLData source (optimality)=Pure-8-20, Algorithm variant=Acting2021.02 | -15.5 | -73 | -108 | |
| MORELData source (optimality)=Pure-8-20, Algorithm variant=Acting2021.02 | -781 | -613.1 | -847.1 |