Offline Reinforcement Learning on D4RL HalfCheetah Medium
54.1RewardQGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| QGPO2024.05 | 54.1 | |
| RTB2024.05 | 53.7 | |
| IDQL2024.05 | 51 | |
| FQL+BCTraining timesteps=1M, Random seeds=102025.09 | 50.66 | |
| D-QL2024.05 | 50.6 | |
| DD2024.05 | 49.1 | |
| IQLTraining timesteps=1M, Random seeds=102025.09 | 47.41 | |
| IQL2023.10 | 47.4 | |
| IQL2024.05 | 47.4 | |
| TT2023.10 | 46.9 | |
| MBOP2023.10 | 44.6 | |
| Diffuser2023.10 | 44.2 | |
| RGG+planning seeds=152023.10 | 44.2 | |
| D2024.05 | 44.2 | |
| CQL2023.10 | 44 | |
| RGGplanning seeds=152023.10 | 44 | |
| CQL2024.05 | 44 | |
| AWAC2022.02 | 43.5 | |
| BC2022.02 | 42.6 | |
| BC2023.10 | 42.6 | |
| DT2023.10 | 42.6 | |
| BC2024.05 | 42.6 | |
| DTLayers=3, Hidden Channels=256, Heads=42022.02 | 42.4 | |
| Linear Trans.Layers=3, Hidden Channels=256, Heads=42022.02 | 42.3 | |
| MOPO2023.10 | 42.3 | |
| ReformerLayers=3, Hidden Channels=256, Heads=42022.02 | 42.2 | |
| FLOWFORMERLayers=3, Hidden Channels=256, Heads=42022.02 | 42.2 | |
| PerformerLayers=3, Hidden Channels=256, Heads=42022.02 | 42.1 | |
| cosFormerLayers=3, Hidden Channels=256, Heads=42022.02 | 42.1 | |
| MOREL2023.10 | 42.1 |