Offline Reinforcement Learning on D4RL MuJoCo Walker2d medium-expert v2
117.2Average Normalized ScoreCBOP
Evaluation Results
| Method | Links | |
|---|---|---|
| CBOP2024.05 | 117.2 | |
| MOBILE2024.05 | 115.2 | |
| ADMPO-OFF2024.05 | 114.9 | |
| EDAC2024.05 | 114.7 | |
| ROMItraining steps=1M, seeds=5, version=v22026.03 | 113.3 | |
| MOPO2024.05 | 112.9 | |
| IQLtraining steps=1M, seeds=5, version=v22026.03 | 110.7 | |
| DOGERatio=1, Size=2M2023.06 | 110.4 | |
| COUNTtraining steps=1M, seeds=5, version=v22026.03 | 110.4 | |
| TD3+BCRatio=1, Size=2M2023.06 | 110.1 | |
| TD3+BC2024.05 | 110.1 | |
| TSRLRatio=1, Size=2M2023.06 | 109.8 | |
| IQLRatio=1, Size=2M2023.06 | 109.6 | |
| CQL2024.05 | 109.1 | |
| CQLRatio=1, Size=2M2023.06 | 108.8 | |
| CQLtraining steps=1M, seeds=5, version=v22026.03 | 107.9 | |
| BCRatio=1, Size=2M2023.06 | 107.5 | |
| COMBO2024.05 | 103.3 | |
| MOBILEtraining steps=1M, seeds=5, version=v22026.03 | 103.2 | |
| MOPOtraining steps=1M, seeds=5, version=v22026.03 | 93.8 | |
| BC2024.05 | 90.1 | |
| RAMBOtraining steps=1M, seeds=5, version=v22026.03 | 73.7 | |
| RAMBO2024.05 | 56.7 | |
| TSRLRatio=1/200, Size=10k2023.06 | 46.4 | |
| MOPORatio=1, Size=2M2023.06 | 44.6 | |
| DOGERatio=1/200, Size=10k2023.06 | 35.3 | |
| IQLRatio=1/200, Size=10k2023.06 | 26.5 | |
| BCRatio=1/200, Size=10k2023.06 | 21.7 | |
| CQLRatio=1/200, Size=10k2023.06 | 19.1 | |
| TD3+BCRatio=1/200, Size=10k2023.06 | 7.9 | |
| MOPORatio=1/200, Size=10k2023.06 | 0.6 |