Reinforcement Learning on busyRingMC2
0.03Execution TimeMungojerrie
Evaluation Results
| Method | Links | |
|---|---|---|
| Mungojerriestates=72, prod.=288, c=-1, ε=0.1, α=0.1, η=0.01, train-steps=10k2025.05 | 0.03 | |
| Q-learning with reduction (Hahn et al. 2019)states=72, prod.=288, c=-1, ε=0.1, α=0.1, η=0.01, train-steps=10k2025.05 | 0.03 | |
| Q-learning with reduction (Bozkurt et al. 2020)states=72, prod.=288, c=-1, ε=0.1, α=0.1, η=0.01, train-steps=10k2025.05 | 0.03 |