Offline Reinforcement Learning on D4RL MuJoCo Halfcheetah-e v2 (expert)
95.6Normalized ScoreCQL
Evaluation Results
| Method | Links | |
|---|---|---|
| CQLRatio=1, Size=1M2023.06 | 95.6 | |
| TSRLRatio=1, Size=1M2023.06 | 94.3 | |
| DOGERatio=1, Size=1M2023.06 | 93.5 | |
| BCRatio=1, Size=1M2023.06 | 92.2 | |
| IQLRatio=1, Size=1M2023.06 | 88.9 | |
| TD3+BCRatio=1, Size=1M2023.06 | 82.1 | |
| TSRLRatio=1/100, Size=10k2023.06 | 40.6 | |
| CQLRatio=1/100, Size=10k2023.06 | 4.2 | |
| TD3+BCRatio=1/100, Size=10k2023.06 | 1.72 | |
| MOPORatio=1, Size=1M2023.06 | 1.4 | |
| DOGERatio=1/100, Size=10k2023.06 | 1.4 | |
| BCRatio=1/100, Size=10k2023.06 | 1.1 | |
| MOPORatio=1/100, Size=10k2023.06 | -0.6 | |
| IQLRatio=1/100, Size=10k2023.06 | -2 |