Offline Reinforcement Learning on D4RL Adroit relocate v0 (cloned)
0.9Normalized ScoreReBRAC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 0.9 | — | |
| FACPolicy Type=Flow, Seeds=82026.02 | 0.5 | — | |
| Easy BCQAlgorithmic Template=One-step2021.06 | 0.3 | — | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 0.2 | — | |
| Rev. KL Reg.Algorithmic Template=One-step2021.06 | 0.1 | — | |
| Exp. WeightAlgorithmic Template=One-step2021.06 | 0.1 | — | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 0.1 | — | |
| BCAlgorithmic Template=One-step2021.06 | 0 | — | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 0 | — | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 0 | — | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 0 | — | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 0 | — | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 0 | — | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 0 | — | |
| Fu et al.Algorithmic Template=Iterative2021.06 | -0.1 | — | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | -0.1 | — | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | -0.1 | — | |
| BC2021.10 | — | 0.1 | |
| CQLImplementation Source=Paper2021.10 | — | -0.1 | |
| CQLImplementation Source=Reproduced2021.10 | — | 0 | |
| EDACImplementation Source=Ours2021.10 | — | 0 | |
| REM2021.10 | — | -0.2 | |
| SAC2021.10 | — | -0.1 | |
| SAC-NImplementation Source=Ours2021.10 | — | 0 |