Offline Reinforcement Learning on D4RL MuJoCo Walker2d-mr v2 (medium-replay)
95.6Average Normalized ScoreADMPO-OFF
Evaluation Results
| Method | Links | |
|---|---|---|
| ADMPO-OFF2024.05 | 95.6 | |
| CBOP2024.05 | 92.7 | |
| MOBILE2024.05 | 89.9 | |
| RAMBO2024.05 | 89.2 | |
| DOGERatio=1, Size=300k2023.06 | 87.3 | |
| EDAC2024.05 | 87.1 | |
| MOPO2024.05 | 85.6 | |
| Trajectory Transformer2024.06 | 82.6 | |
| TD3+BCRatio=1, Size=300k2023.06 | 81.8 | |
| TD3+BC2024.05 | 81.8 | |
| Decision Mamba2024.06 | 79.3 | |
| Critic-Guided Decision Transformer2024.06 | 78.1 | |
| CQLRatio=1, Size=300k2023.06 | 77.2 | |
| CQL2024.05 | 76.8 | |
| Decision Diffuser2024.06 | 75 | |
| IQLRatio=1, Size=300k2023.06 | 73.9 | |
| TSRLRatio=1, Size=300k2023.06 | 66.1 | |
| Diffuser2024.06 | 61.2 | |
| COMBO2024.05 | 56 | |
| MOPORatio=1, Size=300k2023.06 | 39 | |
| BCRatio=1, Size=300k2023.06 | 26 | |
| TSRLRatio=1/30, Size=10k2023.06 | 26 | |
| BC2024.05 | 20.3 | |
| DOGERatio=1/30, Size=10k2023.06 | 13.5 | |
| IQLRatio=1/30, Size=10k2023.06 | 10.7 | |
| CQLRatio=1/30, Size=10k2023.06 | 8.5 | |
| TD3+BCRatio=1/30, Size=10k2023.06 | 5.7 | |
| MOPORatio=1/30, Size=10k2023.06 | 3.3 | |
| BCRatio=1/30, Size=10k2023.06 | 1.4 |