Offline Reinforcement Learning on DeepMind Control Suite hopper-stand plan2explore
54.1Mean Normalized ReturnLAWM
Evaluation Results
| Method | Links | |
|---|---|---|
| LAWMaction-conditioned data percentage=5%2025.12 | 54.1 | |
| C-LAPaction-conditioned data percentage=100%, variant=Oracle2025.12 | 51.4 | |
| C-LAPaction-conditioned data percentage=5%2025.12 | 27.3 | |
| IDM-TD3+BCaction-conditioned data percentage=5%2025.12 | 2.6 | |
| TD3+BCaction-conditioned data percentage=100%, variant=Oracle2025.12 | 2.3 | |
| TD3+BCaction-conditioned data percentage=5%2025.12 | 0.8 |