Offline Reinforcement Learning on D4RL Mujoco Hopper-Medium-Expert v2
111.9Normalized ScoreDecision Mamba
Evaluation Results
| Method | Links | |
|---|---|---|
| Decision Mamba2024.06 | 111.9 | |
| Decision Diffuser2024.06 | 111.8 | |
| TAILO2023.11 | 111.5 | |
| Trajectory Transformer2024.06 | 110 | |
| MOReL2023.11 | 108.7 | |
| Critic-Guided Decision Transformer2024.06 | 107.6 | |
| Diffuser2024.06 | 107.2 | |
| CQLRatio=1, Size=2M2023.06 | 105.4 | |
| DOGERatio=1, Size=2M2023.06 | 102.7 | |
| TD3+BCRatio=1, Size=2M2023.06 | 98 | |
| TSRLRatio=1, Size=2M2023.06 | 95.9 | |
| IQLRatio=1, Size=2M2023.06 | 91.5 | |
| BCRatio=1, Size=2M2023.06 | 52.5 | |
| TSRLRatio=1/200, Size=10k2023.06 | 50.9 | |
| DOGERatio=1/200, Size=10k2023.06 | 50.5 | |
| IQLRatio=1/200, Size=10k2023.06 | 34.3 | |
| CQLRatio=1/200, Size=10k2023.06 | 29.9 | |
| BCRatio=1/200, Size=10k2023.06 | 27.8 | |
| MOPO2023.11 | 23.7 | |
| MOPORatio=1, Size=2M2023.06 | 23.7 | |
| TD3+BCRatio=1/200, Size=10k2023.06 | 17.8 | |
| MOPORatio=1/200, Size=10k2023.06 | 5.8 |