Offline Reinforcement Learning on D4RL MuJoCo Hopper-medium-v2
107.4Avg Normalized ScoreADMPO-OFF
Evaluation Results
| Method | Links | |
|---|---|---|
| ADMPO-OFF2024.05 | 107.4 | |
| MOBILE2024.05 | 106.6 | |
| ROMItraining steps=1M, seeds=5, version=v22026.03 | 105 | |
| CBOP2024.05 | 102.6 | |
| EDAC2024.05 | 101.6 | |
| COUNTtraining steps=1M, seeds=5, version=v22026.03 | 100.2 | |
| DOGERatio=1, Size=1M2023.06 | 98.6 | |
| COMBO2024.05 | 97.2 | |
| RAMBOtraining steps=1M, seeds=5, version=v22026.03 | 95.2 | |
| RAMBO2024.05 | 87 | |
| TSRLRatio=1, Size=1M2023.06 | 86.7 | |
| MOBILEtraining steps=1M, seeds=5, version=v22026.03 | 77.6 | |
| MOPOtraining steps=1M, seeds=5, version=v22026.03 | 72.2 | |
| IQLRatio=1, Size=1M2023.06 | 66.3 | |
| IQLtraining steps=1M, seeds=5, version=v22026.03 | 66.2 | |
| MOPO2024.05 | 62.8 | |
| TSRLRatio=1/100, Size=10k2023.06 | 62 | |
| CQL2024.05 | 61.9 | |
| TD3+BCRatio=1, Size=1M2023.06 | 59.3 | |
| TD3+BC2024.05 | 59.3 | |
| CQLRatio=1, Size=1M2023.06 | 58.5 | |
| BC2024.05 | 54.1 | |
| CQLtraining steps=1M, seeds=5, version=v22026.03 | 53 | |
| BCRatio=1, Size=1M2023.06 | 52.9 | |
| IQLRatio=1/100, Size=10k2023.06 | 46.7 | |
| DOGERatio=1/100, Size=10k2023.06 | 44.2 | |
| CQLRatio=1/100, Size=10k2023.06 | 43.1 | |
| TD3+BCRatio=1/100, Size=10k2023.06 | 40.1 | |
| BCRatio=1/100, Size=10k2023.06 | 29.7 | |
| MOPORatio=1, Size=1M2023.06 | 28 | |
| MOPORatio=1/100, Size=10k2023.06 | 5.5 |