Reinforcement Learning on Atari small data setting
731.1Median Human-Normalized ScoreMuZero Reanalyze
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MuZero ReanalyzeEnv. Frames=200M, Training Time=12 hours, Training Steps=1M2019.11 | 731.1 | 2,168.9 | |
| LASEREnv. Frames=200M2019.11 | 431 | — | |
| UNREALEnv. Frames=250M, Hyper-parameters tuned per game=true2019.11 | 250 | 880 | |
| RainbowEnv. Frames=200M, Training Time=10 days2019.11 | 231.1 | — | |
| IMPALAEnv. Frames=200M2019.11 | 191.8 | 957.6 |