Offline Reinforcement Learning on D4RL MuJoCo Halfcheetah-mr v2 (medium-replay)
72.1Avg Normalized ScoreMOPO
Evaluation Results
| Method | Links | |
|---|---|---|
| MOPO2024.05 | 72.1 | |
| MOBILE2024.05 | 71.7 | |
| RAMBO2024.05 | 68.7 | |
| ADMPO-OFF2024.05 | 67.6 | |
| CBOP2024.05 | 66.4 | |
| EDAC2024.05 | 61.3 | |
| BCRatio=1, Size=200k2023.06 | 55.2 | |
| COMBO2024.05 | 55.1 | |
| MOPORatio=1, Size=200k2023.06 | 53.1 | |
| CQLRatio=1, Size=200k2023.06 | 45.5 | |
| CQL2024.05 | 45.3 | |
| TD3+BCRatio=1, Size=200k2023.06 | 44.6 | |
| TD3+BC2024.05 | 44.6 | |
| IQLRatio=1, Size=200k2023.06 | 44.2 | |
| DOGERatio=1, Size=200k2023.06 | 42.8 | |
| TSRLRatio=1, Size=200k2023.06 | 42.2 | |
| BC2024.05 | 37.6 | |
| TSRLRatio=1/20, Size=10k2023.06 | 28.1 | |
| DOGERatio=1/20, Size=10k2023.06 | 23.4 | |
| IQLRatio=1/20, Size=10k2023.06 | 22.7 | |
| TD3+BCRatio=1/20, Size=10k2023.06 | 17.9 | |
| BCRatio=1/20, Size=10k2023.06 | 14.3 | |
| MOPORatio=1/20, Size=10k2023.06 | 11.7 | |
| CQLRatio=1/20, Size=10k2023.06 | 8.1 |