Reinforcement Learning on Real-World RL (RWRL) Hard
244.71Cartpole ScoreSampled MuZero
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Sampled MuZeroArchitecture=LSTM, Number of seeds=32021.04 | 244.71 | 71.16 | 348.09 | 1.19 | |
| DMPO2021.04 | 138.06 | 63.05 | 144.69 | 1.4 | |
| STACX2021.04 | 135.26 | 58.11 | 351.56 | 1.26 | |
| D4PG2021.04 | 108.2 | 59.85 | 280.75 | 1.27 |