Offline Reinforcement Learning on D4RL Medium-Replay v0
47.7HalfCheetah ReturnBRAC-v
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| BRAC-vSeeds=3, Normalization=Expert policy = 1002021.06 | 47.7 | 0.6 | 0.9 | — | |
| CQLSeeds=3, Normalization=Expert policy = 1002021.06 | 46.2 | 48.6 | 26.7 | 19 | |
| AWRSeeds=3, Normalization=Expert policy = 1002021.06 | 40.3 | 28.4 | 15.5 | — | |
| BEARSeeds=3, Normalization=Expert policy = 1002021.06 | 38.6 | 33.7 | 19.2 | — | |
| Decision TransformerSeeds=3, Normalization=Expert policy = 1002021.06 | 36.6 | 82.7 | 66.6 | 18 | |
| BCSeeds=3, Normalization=Expert policy = 1002021.06 | 4.3 | 27.6 | 36.9 | 5.4 |