Offline Reinforcement Learning on D4RL Hopper Medium v2
100.1Normalized ReturnCPED
Evaluation Results
| Method | Links | |
|---|---|---|
| CPED2023.01 | 100.1 | |
| Trajectory Transformerdiscretization=uniform2021.06 | 99.4 | |
| MOReL2023.11 | 95.4 | |
| CQL2021.06 | 95 | |
| Trajectory Transformerdiscretization=quantile2021.06 | 91.5 | |
| SPOT2022.02 | 86 | |
| SPOT2023.01 | 86 | |
| Decision Transformer2021.06 | 82.7 | |
| GACStrategy=Exploration query (GAC-p(y+))2025.12 | 73.2 | |
| Decision Transformer2021.06 | 67.6 | |
| DT2022.02 | 67.6 | |
| DT2023.01 | 67.6 | |
| Trajectory Transformerdiscretization=uniform2021.06 | 67.4 | |
| IQL2022.02 | 66.2 | |
| IQL2023.01 | 66.2 | |
| Behavior Cloning2021.06 | 63.9 | |
| Trajectory Transformerdiscretization=quantile2021.06 | 61.1 | |
| GACStrategy=Exploitation query (GAC-E[y])2025.12 | 60.2 | |
| Onestep2022.02 | 59.6 | |
| Onestep RL2023.01 | 59.6 | |
| TD3+BC2022.02 | 59.3 | |
| TD3+BC2023.01 | 59.3 | |
| CQL2021.06 | 58.5 | |
| CQL2022.02 | 58.5 | |
| CQL2023.01 | 58.5 | |
| LPT2025.12 | 58.5 | |
| DT2025.12 | 57.3 | |
| GACStrategy=Fixed target steering (GAC-y*)2025.12 | 57.1 | |
| AWAC2022.02 | 57 | |
| AWAC2023.01 | 57 | |
| TAILO2023.11 | 56.2 | |
| GACStrategy=Sampling from prior (p(y|z)p(z))2025.12 | 53.7 | |
| BC2022.02 | 52.9 | |
| BC2023.01 | 52.9 | |
| QDT2025.12 | 50.7 | |
| MBOP2021.06 | 48.8 | |
| IQL2025.12 | 35.1 | |
| BRAC2021.06 | 31.3 | |
| MOPO2023.11 | 28 | |
| Behavior Cloning2021.06 | 27.6 | |
| CQL2025.12 | 23.3 | |
| MBOP2021.06 | 12.4 | |
| BRAC2021.06 | 0.6 |