ResearchBenchmarksReinforcement Learning on Atari large data settingFollow2,041.1Median Human-Normalized ScoreMuZero369.82803.711,237.61,671.49Nov 19, 2019Evaluation ResultsMethodMethodLinksMedian Human-Normalized ScoreMean Human-Normalized ScoreMuZeroEnv. Frames=20.0B, Tra...Env. Frames=20.0B, Training Time=12 hours, Training Steps=1M2019.112,041.14,999.2R2D2Env. Frames=37.5B, Tra...Env. Frames=37.5B, Training Time=5 days, Training Steps=2.16M2019.111,920.64,024.9Ape-XEnv. Frames=22.8B, Tra...Env. Frames=22.8B, Training Time=5 days, Training Steps=8.64M2019.11434.11,695.6