Reinforcement Learning on Atari 2600 (37 Game Evaluation Set)
7,128Alien Scorehuman
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| human2019.03 | 7,128 | 1,720 | 742 | 8,503 | 47,389 | 29,028 | 753 | 37,188 | 16,926 | 161 | 12 | 30 | 7,388 | 35,829 | 1,971 | -39 | 30 | 1 | 2,412 | 3,351 | 30,826 | 1 | 303 | 3,035 | 2,666 | 22,736 | 6,952 | 8,049 | 15 | 69,571 | 13,455 | 17,118 | 7,845 | 42,055 | 11,693 | 54,577 | |
| RainbowTraining steps=1m2019.03 | 945 | 275.8 | 1,581.8 | 2,151.6 | 1,071.5 | 848,800 | 1,053.3 | 22,391.4 | 6,945.3 | 30.6 | 80.3 | 38.7 | 2,474 | 97,088.1 | 5,478.6 | -23.2 | 13 | 2,972.3 | 1,905 | 260 | 13,295.5 | -6.5 | 692.6 | 4,084.6 | 4,971.1 | 21,258.6 | 1,881.4 | 4,454.2 | 20.6 | 2,336.7 | 8,885.2 | 7,018.9 | 31,379.7 | 3,279.9 | 8,010.9 | 8,225.1 | |
| RainbowTraining steps=500k2019.03 | 828.6 | 194 | 1,041.5 | 1,702.7 | 895.9 | 79,541 | 727.3 | 19,507.1 | 5,890 | 31 | 58.2 | 26.7 | 1,765.2 | 75,655.1 | 3,642.1 | -66.7 | 12.6 | 1,386.1 | 1,640.5 | 214.9 | 10,664.3 | -9.7 | 429.7 | 970.9 | 4,139.4 | 19,346.1 | 1,558 | 4,886.5 | 19.9 | -6.2 | 4,241.7 | 5,068.6 | 18,415.4 | 1,558.7 | 6,120.7 | 7,005.7 | |
| SimPLe2019.03 | 616.9 | 74.3 | 527.2 | 1,128.3 | 793.6 | 20,992.5 | 34.2 | 4,031.2 | 621.6 | 30 | 7.8 | 16.4 | 979.4 | 62,583.6 | 208.1 | -90.7 | 16.7 | 236.9 | 596.8 | 173.4 | 2,656.6 | -11.6 | 100.5 | 51.2 | 2,204.8 | 14,862.5 | 1,480 | 2,420.7 | 2.8 | 35 | 1,288.8 | 1,957.8 | 5,640.6 | 683.3 | 3,350.3 | 5,664.3 | |
| PPOTraining steps=1m2019.03 | 362 | 123.8 | 1,134.4 | 2,185 | 1,251 | — | 856 | 19,000 | 684 | 35.8 | 19.6 | 128 | 970 | 58,000 | 241 | -88.8 | 20.8 | 229 | 696 | 325 | 3,719 | -5.3 | 310 | 840 | 5,061.8 | 13,780 | 594 | 2,311 | 14.7 | 20 | 2,675 | 2,887 | 8,930 | 882 | 13,777 | 9,495 | |
| PPOTraining steps=100k2019.03 | 291 | 56.5 | 424.2 | 385 | 1,134 | 34,316.7 | 16 | 5,300 | 563.6 | 17.7 | -3.9 | 5.9 | 730 | 18,400 | 192.5 | -95.6 | 8 | 174 | 246 | 235 | 569 | -10 | 65 | 140 | 3,750.4 | 4,820 | 496 | 2,225 | -20.5 | 10 | 362.5 | 1,398 | 1,430 | 370 | 874 | 5,182 | |
| RainbowTraining steps=100k2019.03 | 290.6 | 20.8 | 300.3 | 285.7 | 912.3 | 17,881.8 | 34.5 | 3,363.5 | 365.6 | 24.7 | 0.9 | 3.3 | 776.6 | 12,558.3 | 431.6 | -91.1 | 0.1 | 140.1 | 748.3 | 231.4 | 2,676.3 | -9.5 | 61.7 | 38.7 | 2,978.8 | 1,019.4 | 364.3 | 2,368.2 | -19.5 | 42.1 | 235.6 | 1,904.2 | 524.1 | 206.3 | 1,346.3 | 3,649 | |
| PPOTraining steps=500k2019.03 | 269 | 93.2 | 552.3 | 1,085 | 1,053 | 4,836,416.7 | 641 | 14,400 | 497.6 | 28.5 | 3.5 | 66.1 | 860 | 33,420 | 216.5 | -87.2 | 14 | 214 | 560 | 235 | 1,824 | -6.6 | 255 | 340 | 3,056.1 | 17,370 | 306 | 2,106 | -8.6 | 20 | 757.5 | 2,865 | 5,750 | 692 | 12,126 | 8,064.8 | |
| random2019.03 | 184.8 | 11.8 | 233.7 | 248.8 | 649 | 16,492 | 15 | 2,895 | 372.1 | 24.2 | 0.3 | 0.9 | 671 | 7,339.5 | 140 | -93.6 | 0 | 74 | 245.9 | 227.2 | 224.6 | -9.7 | 29.2 | 42 | 1,543.3 | 616.5 | 235.2 | 2,136.8 | -20.4 | 26.6 | 166.1 | 1,451 | 0 | 61.1 | 488.4 | 3,121.2 |