Reinforcement Learning on frozen Large
4.07Execution TimeMungojerrie
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mungojerriestates=64, prod.=256, c=-1, ε=0.1, α=0.02, η=0.02, train-steps=3M2025.05 | 4.07 | — | — | |
| Q-learning with reduction (Bozkurt et al. 2020)states=64, prod.=256, c=-1, ε=0.1, α=0.02, η=0.02, train-steps=3M2025.05 | — | — | 8.79 | |
| Q-learning with reduction (Hahn et al. 2019)states=64, prod.=256, c=-1, ε=0.1, α=0.02, η=0.02, train-steps=3M2025.05 | — | 3.88 | — |