Offline Reinforcement Learning on MuJoCo halfcheetah-medium-replay D4RL
54.1Normalized ReturnQCS-R
Evaluation Results
| Method | Links | |
|---|---|---|
| QCS-RMethod Category=Ours2024.02 | 54.1 | |
| ReBRAC2024.10 | 51 | |
| CQLMethod Category=Value-Based2024.02 | 45.5 | |
| CQL2024.10 | 45.5 | |
| SQLMethod Category=Value-Based2024.02 | 44.8 | |
| TD3+BCMethod Category=Value-Based2024.02 | 44.6 | |
| TD3+BC2024.10 | 44.6 | |
| IQLMethod Category=Value-Based2024.02 | 44.2 | |
| IQL2024.10 | 44.2 | |
| PORMethod Category=Combined Method2024.02 | 43.5 | |
| ACTMethod Category=Combined Method2024.02 | 43 | |
| DCMethod Category=RCSL2024.02 | 41.3 | |
| OTR+IQL2024.10 | 41.3 | |
| CGDTMethod Category=Combined Method2024.02 | 40.4 | |
| One-RL2024.10 | 38.1 | |
| RvS-RMethod Category=RCSL2024.02 | 38 | |
| EDTMethod Category=Combined Method2024.02 | 37.8 | |
| DTMethod Category=RCSL2024.02 | 36.6 | |
| BC2024.10 | 36.6 | |
| QDTMethod Category=Combined Method2024.02 | 35.6 |