Offline Reinforcement Learning on D4RL Hopper Medium-Replay
100.7RewardD-QL
Evaluation Results
| Method | Links | |
|---|---|---|
| D-QL2024.05 | 100.7 | |
| RTB2024.05 | 100.4 | |
| DD2024.05 | 100 | |
| QGPO2024.05 | 96.9 | |
| Diffuser2023.10 | 96.8 | |
| D2024.05 | 96.8 | |
| RGG+planning seeds=152023.10 | 95.8 | |
| RGGplanning seeds=152023.10 | 95.2 | |
| CQL2023.10 | 95 | |
| CQL2024.05 | 95 | |
| IQL2023.10 | 94.7 | |
| IQL2024.05 | 94.7 | |
| MOREL2023.10 | 93.6 | |
| IDQL2024.05 | 92.1 | |
| TT2023.10 | 91.5 | |
| IQLTraining timesteps=1M, Random seeds=102025.09 | 88.46 | |
| DT2023.10 | 82.7 | |
| Transformer2024.05 | 79.73 | |
| DTLayers=3, Hidden Channels=256, Heads=42022.02 | 79.7 | |
| Aaren2024.05 | 77.87 | |
| FLOWFORMERLayers=3, Hidden Channels=256, Heads=42022.02 | 75.5 | |
| Linear Trans.Layers=3, Hidden Channels=256, Heads=42022.02 | 74.3 | |
| FQL+BCTraining timesteps=1M, Random seeds=102025.09 | 73.33 | |
| MOPO2023.10 | 67.5 | |
| ReformerLayers=3, Hidden Channels=256, Heads=42022.02 | 66.1 | |
| PerformerLayers=3, Hidden Channels=256, Heads=42022.02 | 64.6 | |
| cosFormerLayers=3, Hidden Channels=256, Heads=42022.02 | 59.3 | |
| AWAC2022.02 | 37.2 | |
| BC2022.02 | 18.1 | |
| BC2023.10 | 18.1 | |
| BC2024.05 | 18.1 | |
| MBOP2023.10 | 12.4 |