Reinforcement Learning on Atari 100K 36 games
423.3Alien ScoreOurs
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| OursFrame stacking=1 frame, Runs averaged=52020.10 | 423.3 | 48.1 | 30.5 | 10.1 | 408.3 | 27.8 | 456.5 | 146.4 | 989.9 | 88.7 | 15,463.7 | 5,478.7 | 249.3 | 49.8 | 5,531.3 | 2,515.4 | 527.6 | 61.8 | 24.5 | 5.1 | -9.3 | 12.6 | 8.1 | 1.5 | 590.6 | 335 | 36,923.8 | 2,780.6 | 211.3 | 86.2 | -87.9 | 4.1 | 11.3 | 9.6 | 219.1 | 45.6 | 1,398.4 | 166.5 | 82.2 | 64.5 | 3,911.6 | 1,259.3 | -12 | 2.1 | 46.6 | 24.2 | 276.3 | 136.7 | 3,241 | 448.4 | 8,521.2 | 1,330.9 | 668.3 | 86.4 | 2,119.4 | 217.9 | -3.9 | 7.6 | 96.9 | 5.4 | 617.5 | 149.5 | 2,273.3 | 188.5 | 1,723.8 | 688.2 | 531.5 | 105.1 | 1,354.6 | 741.4 | 4,360.3 | 1,156.9 | |
| OursFrame stacking=4 frames, Runs averaged=52020.10 | 409.9 | 73 | 37.6 | 13.6 | 375.4 | 111.9 | 504.4 | 53.3 | 862.9 | 85.4 | 9,413.1 | 3,349.8 | 101.2 | 17.4 | 5,631.2 | 1,179.1 | 410.4 | 55.4 | 27.9 | 4.8 | -2.8 | 5.7 | 8.8 | 1.5 | 766.2 | 195.3 | 47,536.9 | 6,114.9 | 195 | 76.4 | -89.6 | 4.5 | 24.6 | 3.4 | 214.4 | 10.2 | 687.2 | 91.1 | 87.2 | 60.9 | 3,453.6 | 594.7 | -13.6 | 2.5 | 66.6 | 7.8 | 245 | 99.6 | 3,520.2 | 211.4 | 11,903.1 | 4,399.5 | 652.2 | 92.6 | 2,448.4 | 179.5 | 11.8 | 6.9 | 99.4 | 1.2 | 480.9 | 143.5 | 2,100.2 | 50.4 | 1,562.5 | 440.2 | 458.1 | 155.7 | 1,128.2 | 247.6 | 4,096 | 520.9 | |
| SimPLeStochastic Dynamics (SD)=true, Discount factor (gamma)=0.992020.10 | 405.2 | 130.8 | 88 | 23.8 | 369.3 | 107.8 | 1,089.5 | 335.3 | 731 | 165.3 | 14,481.6 | 2,436.9 | 8.2 | 4.4 | 5,184.4 | 1,347.5 | 422.7 | 103.6 | 34.4 | 16.3 | 9.1 | 8.8 | 12.7 | 3.8 | 1,246.9 | 392 | 39,827.8 | 22,582.6 | 169.5 | 41.8 | -91.5 | 2.8 | 20.3 | 18.5 | 254.7 | 4.9 | 771 | 160.2 | 198.3 | 39.9 | 1,295.1 | 1,600.1 | -10.5 | 2.2 | 125.3 | 112.5 | 323.1 | 359.8 | 4,539.9 | 2,470.4 | 17,257.2 | 5,502.6 | 762.8 | 331.5 | 1,990.4 | 284.7 | 5.2 | 9.7 | 58.3 | 45.4 | 559.8 | 183.8 | 1,587 | 818 | 5,169.4 | 3,939 | 370.9 | 128.2 | 2,152.6 | 1,192.4 | 2,980.2 | 778.6 | |
| PPOTraining steps=100K2020.10 | 291 | 40.3 | 56.5 | 20.8 | 424.2 | 55.8 | 385 | 104.4 | 1,134 | 326.9 | 34,316.7 | 5,703.8 | 16 | 12.4 | 5,300 | 3,655.1 | 563.6 | 189.4 | 17.7 | 11.2 | -3.9 | 6.4 | 5.9 | 3.3 | 730 | 199 | 18,400 | 5,275.1 | 192.5 | 83.1 | -95.6 | 4.3 | 8 | 9.8 | 174 | 40.7 | 246 | 103.3 | 235 | 197.2 | 569 | 1,100.9 | -10 | 2.1 | 65 | 46.4 | 140 | 102 | 3,750.4 | 3,071.9 | 4,820 | 983.2 | 496 | 379.8 | 2,225 | 423.7 | -20.5 | 0.6 | 10 | 20 | 362.5 | 117.8 | 1,398 | 513.8 | 1,430 | 760 | 370 | 103.3 | 2,874 | 1,105.8 | 5,182 | 1,209.3 |