Regret Minimization on Episodic Tabular MDPs Adversarial Regime
2Regret Upper BoundDann et al. (2023, Theorem 4.3)
Evaluation Results
| Method | Links | |
|---|---|---|
| Dann et al. (2023, Theorem 4.3)Unknown transition=false, Data-dependent=FO, Bandit feedback=true2026.06 | 2 | |
| Li et al. (2026)Unknown transition=false, Data-dependent=true, Bandit feedback=true2026.06 | 2 | |
| This work (Theorem 4.1)Unknown transition=true, Data-dependent=true, Bandit feedback=false2026.06 | 2 | |
| This work (Theorem 4.2)Unknown transition=true, Data-dependent=true, Bandit feedback=true2026.06 | 3 | |
| Luo et al. (2021)Unknown transition=false, Data-dependent=true, Bandit feedback=true2026.06 | 4 | |
| Dann et al. (2023, Theorem 4.2)Unknown transition=false, Data-dependent=true, Bandit feedback=true2026.06 | 4 |