Reinforcement Learning on Stochastic GridWorld (20% slip probability) (test)
85Success RateSat-EnQ
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Sat-EnQtraining steps=10,000, seeds=10, K=4, m=0.5, alpha=0.99, lambda=0.1, gamma=0.992025.12 | 85 | — | 5 | 0.047 | |
| Bootstrapped DQNtraining steps=10,000, seeds=102025.12 | 15 | — | 65 | 0.058 | |
| Maxmin Q-learningtraining steps=10,000, seeds=102025.12 | 12 | — | 70 | 0.062 | |
| Double DQNtraining steps=10,000, seeds=102025.12 | 10 | — | 75 | 0.071 | |
| DQNtraining steps=10,000, seeds=102025.12 | 5 | — | 80 | 0.079 |