Reinforcement Learning on windy
1.4Time (s)Mungojerrie
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mungojerriestates=123, prod.=366, c=-1, ε=0.95, α=0.5, η=0.05, train-steps=1M2025.05 | 1.4 | — | — | |
| Q-learning with reduction (Bozkurt et al. 2020)states=123, prod.=366, c=-1, ε=0.95, α=0.5, η=0.05, train-steps=1M2025.05 | — | — | 2.61 | |
| Q-learning with reduction (Hahn et al. 2019)states=123, prod.=366, c=-1, ε=0.95, α=0.5, η=0.05, train-steps=1M2025.05 | — | 1.81 | — |