Reinforcement Learning on DMControl cartpole-swingup (expert)
20.43Averaged Normalized ScoreIQL
Evaluation Results
| Method | Links | |
|---|---|---|
| IQLBase Algorithm=IQL, S2P Augmentation=false2022.09 | 20.43 | |
| CQLBase Algorithm=CQL, S2P Augmentation=false2022.09 | 19.35 | |
| CQL+S2PBase Algorithm=CQL, S2P Augmentation=true2022.09 | 18.54 | |
| IQL+S2PBase Algorithm=IQL, S2P Augmentation=true2022.09 | 18.37 | |
| SLAC-offBase Algorithm=SLAC-off, S2P Augmentation=false2022.09 | 14.11 | |
| SLAC-off+S2PBase Algorithm=SLAC-off, S2P Augmentation=true2022.09 | 11.18 |