Uncoupled learning with bandit feedback on Zero-sum matrix games
1Convergence Rate BoundCai et al. 2023 (Algorithm 1)
Evaluation Results
| Method | Links | |
|---|---|---|
| Cai et al. 2023 (Algorithm 1)Convergence=High probability2026.04 | 1 | |
| Cai et al. 2023 (Algorithm 1)Convergence=L^22026.04 | 1 | |
| Dong et al. 2024 (Algorithm 1)Convergence=High probability2026.04 | 1 | |
| Simultaneous Explore or ExploitConvergence=L^p, p ∈ (0, 2]2026.04 | 1 | |
| Uncoupled Regularized EXP3Convergence=L^22026.04 | 1 | |
| Lower boundConvergence=L^p, p ∈ (0, 2]2026.04 | 1 |