Reinforcement Learning on Beam Rider Atari 2600 (test)
7,456Average Episode RewardHuman
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Humanagent=expert human player2013.12 | 7,456 | — | |
| DQNpolicy=epsilon-greedy, epsilon=0.05, input=raw pixels2013.12 | 4,092 | — | |
| Contingencypolicy=epsilon-greedy, epsilon=0.052013.12 | 1,743 | — | |
| Sarsapolicy=epsilon-greedy, epsilon=0.052013.12 | 996 | — | |
| Randompolicy=random2013.12 | 354 | — | |
| DQN Bestpolicy=epsilon-greedy, epsilon=0.05, evaluation=best episode2013.12 | — | 5,184 | |
| HNeat Bestpolicy=deterministic, evaluation=best episode2013.12 | — | 3,616 | |
| HNeat Pixelpolicy=deterministic, evaluation=best episode, input=8 color channel representation2013.12 | — | 1,332 |