Reinforcement Learning on MinAtar (Individual Game Scores)
71.34Freeway ScoreITC
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| ITCEnvironment interactions=1M, Evaluation episodes=1,0002026.05 | 71.34 | 99.53 | 188.85 | — | 50.04 | |
| Dedieu et al.Environment interactions=1M, Evaluation episodes=1,0002026.05 | 71.12 | 93.92 | 186.16 | — | 44.81 | |
| ARQBackpropagation usage=w/o back-prop2025.10 | 60.74 | 87.84 | 544.99 | 96.45 | 35.32 | |
| DQNMacro-actions=false, Evaluation episodes=100, Random seeds=202025.09 | 60.44 | 180.36 | 1.16 | 109.2 | 284.38 | |
| RL-D2Macro-actions=true, Evaluation episodes=100, Random seeds=202025.09 | 59.98 | 20.58 | 184.3 | 164.2 | 52.38 | |
| DQN-MACROMacro-actions=true, Evaluation episodes=100, Random seeds=202025.09 | 58.42 | 315.85 | 769.86 | 166.65 | 43.05 | |
| ADEnvironment interactions=5M, Evaluation episodes=1,0002026.05 | 57.68 | 27.78 | 140.36 | — | 21.05 | |
| ADBackpropagation usage=w/o back-prop2025.10 | 57.12 | 63.76 | 363.49 | 27.83 | 22.01 | |
| DQNBackpropagation usage=w/ back-prop2025.10 | 55.86 | 27.09 | 188.03 | 37.96 | 13.6 | |
| IMPALA-MACROMacro-actions=true, Evaluation episodes=100, Random seeds=202025.09 | 54.09 | 7.21 | 33.18 | 55.42 | 21.29 | |
| IMPALAMacro-actions=false, Evaluation episodes=100, Random seeds=202025.09 | 41.01 | 1.02 | 47.71 | 44.55 | 24.78 |