Offline Reinforcement Learning on D4RL mujoco-hopper (med-replay)
100Normalized ScoreDD
Evaluation Results
| Method | Links | |
|---|---|---|
| DD2023.10 | 100 | |
| ROMI-CQL2021.10 | 98.1 | |
| TTConfiguration=Trifle2023.10 | 97.8 | |
| CQL2021.10 | 97 | |
| CQL2023.10 | 95 | |
| IQL2023.10 | 94.7 | |
| MOREL2021.10 | 93.6 | |
| TTConfiguration=base2023.10 | 91.5 | |
| TT(+Q)Configuration=Trifle2023.10 | 87.6 | |
| TT(+Q)Configuration=base2023.10 | 83.4 | |
| DTConfiguration=base2023.10 | 82.7 | |
| %BC2023.10 | 75.9 | |
| COMBO2021.10 | 73.1 | |
| TD3(+BC)2023.10 | 60.9 | |
| BAIL2021.10 | 54.7 | |
| BCQ2021.10 | 53.2 | |
| ROMI-BCQ2021.10 | 39.1 | |
| MOPO2021.10 | 39.1 | |
| BEAR2021.10 | 30.6 | |
| BC2021.10 | 8.1 | |
| BRAC-v2021.10 | 6.1 | |
| Repb-SDE2021.10 | 5.7 | |
| BRAC-P2021.10 | 1.2 |