Offline Reinforcement Learning on D4RL MuJoCo Halfcheetah-m v2 (medium)
48.3Average Normalized ScoreTD3+BC
Evaluation Results
| Method | Links | |
|---|---|---|
| TD3+BCRatio=1, Size=1M2023.06 | 48.3 | |
| TSRLRatio=1, Size=1M2023.06 | 48.2 | |
| DOGERatio=1, Size=1M2023.06 | 45.4 | |
| IQLRatio=1, Size=1M2023.06 | 45.3 | |
| CQLRatio=1, Size=1M2023.06 | 44 | |
| BCRatio=1, Size=1M2023.06 | 42.6 | |
| MOPORatio=1, Size=1M2023.06 | 42.3 | |
| TSRLRatio=1/100, Size=10k2023.06 | 38.4 | |
| DOGERatio=1/100, Size=10k2023.06 | 36.2 | |
| CQLRatio=1/100, Size=10k2023.06 | 35.8 | |
| IQLRatio=1/100, Size=10k2023.06 | 29.9 | |
| BCRatio=1/100, Size=10k2023.06 | 26.4 | |
| TD3+BCRatio=1/100, Size=10k2023.06 | 16.4 | |
| MOPORatio=1/100, Size=10k2023.06 | -1.1 |