Regret Minimization on Episodic Tabular MDPs Stochastic Regime with Adversarial Corruption
2Regret Upper BoundDann et al. (2023, Theorem 4.3)
Evaluation Results
| Method | Links | |
|---|---|---|
| Dann et al. (2023, Theorem 4.3)Unknown transition=false, Data-dependent=FO, Bandit feedback=true2026.06 | 2 | |
| Li et al. (2026)Unknown transition=false, Data-dependent=true, Bandit feedback=true2026.06 | 2 | |
| This work (Theorem 4.1)Unknown transition=true, Data-dependent=true, Bandit feedback=false2026.06 | 2 | |
| This work (Theorem 4.2)Unknown transition=true, Data-dependent=true, Bandit feedback=true2026.06 | 2 | |
| Dann et al. (2023, Theorem 4.2)Unknown transition=false, Data-dependent=true, Bandit feedback=true2026.06 | 4 |