Reinforcement Learning on Atari 2600 Arcade Learning Environment (evaluation)
3,459Montezuma's Revenge ScoreDDQN-PC
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DDQN-PCTraining frames=100M2017.06 | 3,459 | — | — | — | — | |
| Sarsa-φ-EBTraining frames=100M (80M for Q*bert)2017.06 | 2,745.4 | 1,169.2 | 0 | 2,770.1 | 4,111.8 | |
| Sarsa-eTraining frames=100M (80M for Q*bert)2017.06 | 399.5 | 0 | 29.9 | 1,394.3 | 3,895.3 | |
| A3C+Training frames=200M2017.06 | 142 | 0 | 27 | 507 | 15,805 | |
| TRPO-HashTraining frames=200M2017.06 | 75 | 445 | 34 | 5,214 | — | |
| GorilaTraining frames=200M2017.06 | 4 | 1,245 | 12 | 605 | 10,816 | |
| MP-EBTraining frames=20M2017.06 | 0 | — | 12 | 380 | — | |
| DDQNTraining frames=200M2017.06 | 0 | 98 | 33 | 1,683 | 15,088 | |
| DQN-PATraining frames=200M2017.06 | 0 | 1,172 | 33 | 3,469 | 5,237 | |
| TRPOTraining frames=200M2017.06 | 0 | 121 | 16 | 2,869 | 7,733 | |
| DuelingTraining frames=200M2017.06 | 0 | 497 | 0 | 4,672 | 19,220 |