Online Reinforcement Learning on MinAtar (|A|=216, k=3) Macro-Action
11.98Breakout ScoreDQN
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DQNNumber of seeds=52026.05 | 11.98 | 0.67 | 0.66 | 0.52 | 10.36 | 4.84 | |
| DRIFTCandidate budget=40, Coverage=18.5%, Number of seeds=52026.05 | 8.4 | 0.78 | 0.56 | 1.2 | 9.45 | 4.08 | |
| DRIFT (full)Candidate budget=full, Number of seeds=52026.05 | 7.8 | 0.56 | 0.21 | 0.85 | 6.4 | 3.16 | |
| DQN-SubNumber of seeds=52026.05 | 7.45 | 0.53 | 0 | 0.98 | 10.77 | 3.95 | |
| PPONumber of seeds=52026.05 | 5.83 | 0.65 | 27.9 | 0.66 | 14.25 | 9.86 |