Reinforcement Learning on Real-World RL (RWRL) (Medium)
516.69Cartpole ScoreSampled MuZero
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Sampled MuZeroArchitecture=LSTM, Number of seeds=32021.04 | 516.69 | 448.51 | 946.21 | 108.56 | |
| STACX2021.04 | 398.71 | 94.01 | 466.43 | 1.18 | |
| D4PG2021.04 | 175.47 | 75.49 | 268.01 | 1.28 | |
| DMPO2021.04 | 155.63 | 64.63 | 180.3 | 1.27 |