Offline Reinforcement Learning on D4RL MuJoCo Hopper-mr v2 (medium-replay)
104.4Avg Normalized ScoreADMPO-OFF
Evaluation Results
| Method | Links | |
|---|---|---|
| ADMPO-OFF2024.05 | 104.4 | |
| CBOP2024.05 | 104.3 | |
| MOBILE2024.05 | 103.9 | |
| MOPO2024.05 | 103.5 | |
| ROMItraining steps=1M, seeds=5, version=v22026.03 | 102 | |
| EDAC2024.05 | 101 | |
| Decision Diffuser2024.06 | 100 | |
| RAMBO2024.05 | 99.5 | |
| COUNTtraining steps=1M, seeds=5, version=v22026.03 | 97.6 | |
| Diffuser2024.06 | 96.8 | |
| CQLRatio=1, Size=400k2023.06 | 95 | |
| IQLRatio=1, Size=400k2023.06 | 94.7 | |
| IQLtraining steps=1M, seeds=5, version=v22026.03 | 94 | |
| Critic-Guided Decision Transformer2024.06 | 93.4 | |
| Trajectory Transformer2024.06 | 91.5 | |
| MOPOtraining steps=1M, seeds=5, version=v22026.03 | 90.5 | |
| COMBO2024.05 | 89.5 | |
| Decision Mamba2024.06 | 89.1 | |
| CQLtraining steps=1M, seeds=5, version=v22026.03 | 88.7 | |
| CQL2024.05 | 86.3 | |
| MOBILEtraining steps=1M, seeds=5, version=v22026.03 | 85.7 | |
| TSRLRatio=1, Size=400k2023.06 | 78.7 | |
| RAMBOtraining steps=1M, seeds=5, version=v22026.03 | 77.2 | |
| DOGERatio=1, Size=400k2023.06 | 76.2 | |
| MOPORatio=1, Size=400k2023.06 | 67.5 | |
| TD3+BCRatio=1, Size=400k2023.06 | 60.9 | |
| TD3+BC2024.05 | 60.9 | |
| TSRLRatio=1/40, Size=10k2023.06 | 21.8 | |
| BCRatio=1, Size=400k2023.06 | 18.1 | |
| DOGERatio=1/40, Size=10k2023.06 | 17.9 | |
| BC2024.05 | 16.6 | |
| IQLRatio=1/40, Size=10k2023.06 | 13.4 | |
| BCRatio=1/40, Size=10k2023.06 | 12.1 | |
| TD3+BCRatio=1/40, Size=10k2023.06 | 7.3 | |
| MOPORatio=1/40, Size=10k2023.06 | 6.8 | |
| CQLRatio=1/40, Size=10k2023.06 | 2.3 |