Offline Reinforcement Learning on DeepMind Control Suite walker-walk plan2explore
81.9Mean Normalized ReturnLAWM
Evaluation Results
| Method | Links | |
|---|---|---|
| LAWMaction-conditioned data percentage=5%2025.12 | 81.9 | |
| C-LAPaction-conditioned data percentage=100%, variant=Oracle2025.12 | 69.2 | |
| C-LAPaction-conditioned data percentage=5%2025.12 | 34.1 | |
| TD3+BCaction-conditioned data percentage=100%, variant=Oracle2025.12 | 18.5 | |
| TD3+BCaction-conditioned data percentage=5%2025.12 | 11.8 | |
| IDM-TD3+BCaction-conditioned data percentage=5%2025.12 | 6 |