Offline Reinforcement Learning on D4RL HalfCheetah Medium-Replay
48.11RewardRTB
Evaluation Results
| Method | Links | |
|---|---|---|
| RTB2024.05 | 48.11 | |
| QGPO2024.05 | 47.6 | |
| D-QL2024.05 | 47.5 | |
| IDQL2024.05 | 45.8 | |
| CQL2024.05 | 45.5 | |
| IQL2024.05 | 44.2 | |
| D2024.05 | 42.2 | |
| AWAC2022.02 | 40.5 | |
| DD2024.05 | 39.3 | |
| BC2022.02 | 36.6 | |
| BC2024.05 | 36.6 | |
| FLOWFORMERLayers=3, Hidden Channels=256, Heads=42022.02 | 34.7 | |
| DTLayers=3, Hidden Channels=256, Heads=42022.02 | 34.6 | |
| ReformerLayers=3, Hidden Channels=256, Heads=42022.02 | 33.6 | |
| cosFormerLayers=3, Hidden Channels=256, Heads=42022.02 | 32.8 | |
| Linear Trans.Layers=3, Hidden Channels=256, Heads=42022.02 | 32.1 | |
| PerformerLayers=3, Hidden Channels=256, Heads=42022.02 | 31.7 |