Offline Reinforcement Learning on D4RL Hopper Medium
1,392.93RewardOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 1,392.93 | |
| SSR-RRSrepeats=5, re-trained_on_full_dataset=true2022.10 | 1,304.54 | |
| CVfolds=5, re-trained_on_full_dataset=true2022.10 | 1,304.53 | |
| SSR-RRSrepeats=2, re-trained_on_full_dataset=true2022.10 | 1,296.87 | |
| BVFT-FQEvariant=pi + FQE, re-trained_on_full_dataset=true2022.10 | 1,227.81 | |
| CVfolds=2, re-trained_on_full_dataset=true2022.10 | 1,227.81 | |
| BVFT-FQEvariant=pi x FQE, re-trained_on_full_dataset=true2022.10 | 934.71 | |
| QGPO2024.05 | 98 | |
| MOREL2023.10 | 95.4 | |
| RGG+planning seeds=152023.10 | 84.9 | |
| RTB2024.05 | 82.76 | |
| RGGplanning seeds=152023.10 | 82.5 | |
| D-QL2024.05 | 82.4 | |
| DD2024.05 | 79.3 | |
| DT2023.10 | 67.6 | |
| FLOWFORMERLayers=3, Hidden Channels=256, Heads=42022.02 | 66.9 | |
| IQL2023.10 | 66.3 | |
| IQL2024.05 | 66.3 | |
| IDQL2024.05 | 65.4 | |
| DTLayers=3, Hidden Channels=256, Heads=42022.02 | 64.2 | |
| TT2023.10 | 61.1 | |
| ReformerLayers=3, Hidden Channels=256, Heads=42022.02 | 59.9 | |
| cosFormerLayers=3, Hidden Channels=256, Heads=42022.02 | 59.8 | |
| PerformerLayers=3, Hidden Channels=256, Heads=42022.02 | 59.7 | |
| Linear Trans.Layers=3, Hidden Channels=256, Heads=42022.02 | 58.7 | |
| CQL2023.10 | 58.5 | |
| Diffuser2023.10 | 58.5 | |
| CQL2024.05 | 58.5 | |
| D2024.05 | 58.5 | |
| AWAC2022.02 | 57 | |
| BC2022.02 | 52.9 | |
| BC2023.10 | 52.9 | |
| BC2024.05 | 52.9 | |
| MBOP2023.10 | 48.8 | |
| MOPO2023.10 | 28 |