Reinforcement Learning on windyStoch
2.97TimeMungojerrie
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mungojerriestates=130, prod.=390, c=-1, ε=0.1, α=0.5, η=0.1, train-steps=2M2025.05 | 2.97 | — | — | |
| Q-learning with reduction (Bozkurt et al. 2020)states=130, prod.=390, c=-1, ε=0.1, α=0.5, η=0.1, train-steps=2M2025.05 | — | — | 2.53 | |
| Q-learning with reduction (Hahn et al. 2019)states=130, prod.=390, c=-1, ε=0.1, α=0.5, η=0.1, train-steps=2M2025.05 | — | 3.91 | — |