Offline Reinforcement Learning on D4RL MuJoCo Hopper-e v2 (expert)
110Average Normalized ScoreTSRL
Evaluation Results
| Method | Links | |
|---|---|---|
| TSRLRatio=1, Size=1M2023.06 | 110 | |
| BCRatio=1, Size=1M2023.06 | 108 | |
| DOGERatio=1, Size=1M2023.06 | 107.4 | |
| TD3+BCRatio=1, Size=1M2023.06 | 100.1 | |
| IQLRatio=1, Size=1M2023.06 | 99.3 | |
| CQLRatio=1, Size=1M2023.06 | 98.4 | |
| TSRLRatio=1/100, Size=10k2023.06 | 82.7 | |
| DOGERatio=1/100, Size=10k2023.06 | 54.5 | |
| IQLRatio=1/100, Size=10k2023.06 | 38.4 | |
| CQLRatio=1/100, Size=10k2023.06 | 33 | |
| TD3+BCRatio=1/100, Size=10k2023.06 | 23.2 | |
| BCRatio=1/100, Size=10k2023.06 | 20.8 | |
| MOPORatio=1, Size=1M2023.06 | 16.2 | |
| MOPORatio=1/100, Size=10k2023.06 | 6.5 |