Offline Reinforcement Learning on DeepMind Control Suite cheetah-run plan2explore
28.5Mean Normalized ReturnC-LAP
Evaluation Results
| Method | Links | |
|---|---|---|
| C-LAPaction-conditioned data percentage=100%, variant=Oracle2025.12 | 28.5 | |
| LAWMaction-conditioned data percentage=5%2025.12 | 26.5 | |
| C-LAPaction-conditioned data percentage=5%2025.12 | 12.6 | |
| TD3+BCaction-conditioned data percentage=100%, variant=Oracle2025.12 | 8.6 | |
| IDM-TD3+BCaction-conditioned data percentage=5%2025.12 | 4.8 | |
| TD3+BCaction-conditioned data percentage=5%2025.12 | 4 |