Reinforcement Learning on D4RL Walker broken right thigh (medium)
3,743Mean ReturnH2O
Evaluation Results
| Method | Links | |
|---|---|---|
| H2Otarget interaction steps=10^52023.05 | 3,743 | |
| VGDF + BCtarget interaction steps=10^52023.05 | 3,001 | |
| Offline onlybase algorithm=CQL, target interaction steps=10^52023.05 | 1,453 | |
| Symmetric samplingtarget interaction steps=10^52023.05 | 709 |