Policy Optimization on Multi-Armed Bandits
-7Sample ComplexityLog-barrier
Evaluation Results
| Method | Links | |
|---|---|---|
| Log-barrierLearning Rate alpha=O(ϵ^-3), Assumptions=No ties2026.03 | -7 | |
| Log-barrier, ClippingLearning Rate alpha=O(1/ log t)2026.03 | -6 | |
| Log-barrier, MomentumLearning Rate alpha=O(1/sqrt(t))2026.03 | -4.5 | |
| Vanilla PGLearning Rate alpha=O(1/t), Assumptions=ABC, Weak gradient domination2026.03 | -3 | |
| Entropy regularizationLearning Rate alpha=O(1/t), Assumptions=inf_t min_a πθ(a) > 02026.03 | -2 | |
| Entropy regularized NPGLearning Rate alpha=O(1/ log t), Assumptions=Generative model2026.03 | -2 | |
| Vanilla PG (SGB)Learning Rate alpha=O(1), Assumptions=No ties, c* < inf2026.03 | -1 | |
| Log-barrierLearning Rate alpha=O(1), Assumptions=No ties, c* < inf2026.03 | -1 |