Offline Reinforcement Learning on MuJoCo walker2d-medium D4RL
92.5Normalized ReturnMOPO
Evaluation Results
| Method | Links | |
|---|---|---|
| MOPOselection=best-epoch2025.02 | 92.5 | |
| QCS-RMethod Category=Ours2024.02 | 88.2 | |
| CQLselection=best-epoch2025.02 | 87.7 | |
| IQLselection=best-epoch2025.02 | 87.4 | |
| COMBOselection=best-epoch2025.02 | 87.4 | |
| TD3BCselection=best-epoch2025.02 | 87.4 | |
| SQLMethod Category=Value-Based2024.02 | 84.2 | |
| TD3+BCMethod Category=Value-Based2024.02 | 83.7 | |
| ReBRAC2024.10 | 82.5 | |
| PORMethod Category=Combined Method2024.02 | 81.1 | |
| One-RL2024.10 | 81.1 | |
| ACTMethod Category=Combined Method2024.02 | 80.9 | |
| OTR+IQL2024.10 | 79.4 | |
| DCMethod Category=RCSL2024.02 | 79.2 | |
| CGDTMethod Category=Combined Method2024.02 | 79.1 | |
| IQLMethod Category=Value-Based2024.02 | 78.3 | |
| IQL2024.10 | 78.3 | |
| IOselection=best-epoch2025.02 | 77.5 | |
| BC2024.10 | 75.3 | |
| DTMethod Category=RCSL2024.02 | 74 | |
| EDTMethod Category=Combined Method2024.02 | 72.8 | |
| CQLMethod Category=Value-Based2024.02 | 72.5 | |
| CQL2024.10 | 72.5 | |
| RvS-RMethod Category=RCSL2024.02 | 71.7 | |
| QDTMethod Category=Combined Method2024.02 | 67.1 | |
| TD3+BC2024.10 | 65.5 |