Reinforcement Learning on Real-World RL (RWRL) Easy
861.05Cartpole ScoreSampled MuZero
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Sampled MuZeroArchitecture=LSTM, Number of seeds=32021.04 | 861.05 | 959.83 | 987.2 | 289.36 | |
| STACX2021.04 | 734.4 | 487.75 | 865.8 | 1.21 | |
| D4PG2021.04 | 482.32 | 512.44 | 787.73 | 102.92 | |
| DMPO2021.04 | 464.05 | 474.44 | 567.53 | 1.33 |