Finding an ε-optimal policy from a single trajectory on Communicating average-reward MDPs
-2Sample Complexity Exponent (vs ε)Tuynman et al.
Evaluation Results
| Method | Links | |
|---|---|---|
| Tuynman et al.Method type=model-based, Additional assumptions=none2026.06 | -2 |
| Method | Links | |
|---|---|---|
| Tuynman et al.Method type=model-based, Additional assumptions=none2026.06 | -2 |