Offline Reinforcement Learning on D4RL Walker-medium-replay v2
91.6Normalized ReturnSPOT
Evaluation Results
| Method | Links | |
|---|---|---|
| SPOT2022.02 | 91.6 | |
| RAMBO2022.10 | 89.2 | |
| EDAC2022.10 | 87.1 | |
| TD3+BC2022.02 | 81.8 | |
| PMDB2022.10 | 79.9 | |
| GACStrategy=Exploitation query (GAC-E[y])2025.12 | 78.9 | |
| CQL2022.02 | 77.2 | |
| CQL2022.10 | 76.8 | |
| GACStrategy=Fixed target steering (GAC-y*)2025.12 | 76.6 | |
| IQL2022.02 | 73.8 | |
| GACStrategy=Exploration query (GAC-p(y+))2025.12 | 73.3 | |
| LPT2025.12 | 72.3 | |
| DT2022.02 | 66.6 | |
| DT2025.12 | 51.6 | |
| Onestep2022.02 | 49.5 | |
| MOREL2022.10 | 40.8 | |
| BRAC2022.10 | 40.1 | |
| GACStrategy=Sampling from prior (p(y|z)p(z))2025.12 | 34.3 | |
| QDT2025.12 | 29.6 | |
| AWAC2022.02 | 27 | |
| BC2022.02 | 26 | |
| BC2022.10 | 20.3 | |
| BEAR2022.10 | 12.2 | |
| IQL2025.12 | 5.3 | |
| CQL2025.12 | 3.2 |