Reinforcement Learning on HalfCheetah (Pure-8-40)
7,459Average Reward (0.3/1.7)True env+MPC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| True env+MPCData source (optimality)=Oracle (True Environment)2021.02 | 7,459 | 42,893 | 66,675 | |
| PerSimData source (optimality)=Pure-8-402021.02 | 2,590 | 1,016 | 1,365 | |
| PE-TS CaDMData source (optimality)=Pure-8-402021.02 | 1,500 | 1,218 | 1,339 | |
| CQLData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 808.5 | 1,662 | -156.3 | |
| Vanilla CaDMData source (optimality)=Pure-8-402021.02 | 465.6 | 452.7 | 720 | |
| BCQData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | 269.2 | -181.5 | 193 | |
| BCQData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 78.25 | 173.8 | 417.1 | |
| MORELData source (optimality)=Pure-8-40, Algorithm variant=Planning2021.02 | 8.5 | -114.2 | -195.9 | |
| CQLData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | -6.2 | -386 | 37.1 | |
| MORELData source (optimality)=Pure-8-40, Algorithm variant=Acting2021.02 | -325.9 | -644.5 | -798.8 |