Offline Reinforcement Learning on D4RL MuJoCo halfcheetah v2 (random)
45.4Normalized ScoreADMPO-OFF
Evaluation Results
| Method | Links | |
|---|---|---|
| ADMPO-OFF2024.05 | 45.4 | |
| VIPO-MOBILE2025.04 | 42.5 | |
| RAMBO2024.05 | 39.5 | |
| RAMBO2025.04 | 39.5 | |
| MOBILEtraining steps=1M, seeds=5, version=v22026.03 | 39.4 | |
| MOBILE2024.05 | 39.3 | |
| MOBILE2025.04 | 39.3 | |
| VIPO-MOPO2025.04 | 38.9 | |
| COMBO2024.05 | 38.8 | |
| COMBO2025.04 | 38.8 | |
| MOPO2024.05 | 38.5 | |
| MOPO*Retrained on v2=true2025.04 | 38.5 | |
| ROMItraining steps=1M, seeds=5, version=v22026.03 | 38.4 | |
| COUNTtraining steps=1M, seeds=5, version=v22026.03 | 37.3 | |
| MOPOtraining steps=1M, seeds=5, version=v22026.03 | 36.7 | |
| CBOP2024.05 | 32.8 | |
| CQL2024.05 | 31.3 | |
| CQL2025.04 | 31.3 | |
| RAMBOtraining steps=1M, seeds=5, version=v22026.03 | 29.5 | |
| EDAC2024.05 | 28.4 | |
| MOReL2025.04 | 25.6 | |
| DQL2025.04 | 22.1 | |
| CQLtraining steps=1M, seeds=5, version=v22026.03 | 17.5 | |
| IQL2025.04 | 16.1 | |
| IQLtraining steps=1M, seeds=5, version=v22026.03 | 13.1 | |
| TD3+BC2024.05 | 11 | |
| TD3+BC2025.04 | 10.2 | |
| BC2024.05 | 2.2 |