Offline Reinforcement Learning on D4RL MuJoCo Walker2d-e v2 (expert)
110.2Normalized ScoreTSRL
Evaluation Results
| Method | Links | |
|---|---|---|
| TSRLRatio=1, Size=1M2023.06 | 110.2 | |
| IQLRatio=1, Size=1M2023.06 | 109.7 | |
| TD3+BCRatio=1, Size=1M2023.06 | 108.2 | |
| BCRatio=1, Size=1M2023.06 | 107.9 | |
| DOGERatio=1, Size=1M2023.06 | 107.3 | |
| TSRLRatio=1/100, Size=10k2023.06 | 102.2 | |
| CQLRatio=1, Size=1M2023.06 | 101.3 | |
| DOGERatio=1/100, Size=10k2023.06 | 72.1 | |
| CQLRatio=1/100, Size=10k2023.06 | 41.6 | |
| TD3+BCRatio=1/100, Size=10k2023.06 | 23.8 | |
| IQLRatio=1/100, Size=10k2023.06 | 12.6 | |
| BCRatio=1/100, Size=10k2023.06 | 10.4 | |
| MOPORatio=1/100, Size=10k2023.06 | 1.4 | |
| MOPORatio=1, Size=1M2023.06 | 0.1 |