Offline Reinforcement Learning on D4RL Medium-Expert v0
86.8HalfCheetah ReturnDecision Transformer
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Decision TransformerSeeds=3, Normalization=Expert policy = 1002021.06 | 86.8 | 107.6 | 108.1 | 89.1 | |
| CQLSeeds=3, Normalization=Expert policy = 1002021.06 | 62.4 | 111 | 98.7 | 30.6 | |
| BCSeeds=3, Normalization=Expert policy = 1002021.06 | 59.9 | 79.6 | 36.6 | 73.3 | |
| BEARSeeds=3, Normalization=Expert policy = 1002021.06 | 53.4 | 96.3 | 40.1 | — | |
| AWRSeeds=3, Normalization=Expert policy = 1002021.06 | 52.7 | 27.1 | 53.8 | — | |
| BRAC-vSeeds=3, Normalization=Expert policy = 1002021.06 | 41.9 | 0.8 | 81.6 | — |