Reinforcement Learning on adverse
8.51TimeMungojerrie
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mungojerriestates=202, prod.=507, c=-150, ε=0.1, α=0.2, η=0.1, train-steps=10M2025.05 | 8.51 | — | — | |
| Q-learning with reduction (Bozkurt et al. 2020)states=202, prod.=507, c=-150, ε=0.1, α=0.2, η=0.1, train-steps=10M2025.05 | — | — | 12.56 | |
| Q-learning with reduction (Hahn et al. 2019)states=202, prod.=507, c=-150, ε=0.1, α=0.2, η=0.1, train-steps=10M2025.05 | — | 7.09 | — |