Epsilon-Optimal Policy Finding from Single Trajectory on Ergodic Average-Reward MDPs
-2Sample Complexity Exponent (vs ε)Li et al.
Evaluation Results
| Method | Links | |
|---|---|---|
| Li et al.Method type=model-free, Additional assumptions=none2026.06 | -2 |
| Method | Links | |
|---|---|---|
| Li et al.Method type=model-free, Additional assumptions=none2026.06 | -2 |