Offline Reinforcement Learning on D4RL Adroit pen v0 (cloned)
75.1Normalized Avg ReturnDPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DPPOFramework=Preference Transformer (PT)2023.01 | 75.1 | |
| EDACImplementation Source=Ours2021.10 | 68.2 | |
| Easy BCQAlgorithmic Template=One-step2021.06 | 67 | |
| SAC-NImplementation Source=Ours2021.10 | 64.1 | |
| Fu et al.Algorithmic Template=Iterative2021.06 | 56.9 | |
| Rev. KL Reg.Algorithmic Template=One-step2021.06 | 55.3 | |
| Exp. WeightAlgorithmic Template=One-step2021.06 | 54.7 | |
| BCAlgorithmic Template=One-step2021.06 | 49.3 | |
| PT+IQLFramework=Preference Transformer (PT)2023.01 | 42.9 | |
| CQLImplementation Source=Paper2021.10 | 40.3 | |
| BC2021.10 | 38.3 | |
| PT+%BCFramework=Preference Transformer (PT)2023.01 | 37.4 | |
| CQLImplementation Source=Reproduced2021.10 | 27.2 | |
| PT+CQLFramework=Preference Transformer (PT)2023.01 | 18.3 | |
| SAC2021.10 | -0.8 | |
| REM2021.10 | -1 | |
| PT+RvSFramework=Preference Transformer (PT)2023.01 | -2.2 |