Reinforcement Learning on Continuous MDPs
2RegretAdaMB
Evaluation Results
| Method | Links | |
|---|---|---|
| AdaMBUniform Reward=Yes, Dimension condition=dS > 22026.05 | 2 | |
| AdaMBUniform Reward=Yes, Dimension condition=dS ≤ 22026.05 | 2 | |
| Kernel-UCBVIUniform Reward=Yes2026.05 | 3 | |
| KBVI-BUCBUniform Reward=No2026.05 | 3 | |
| Adaptive Q-learningUniform Reward=Yes2026.05 | 5 | |
| Net-Based Q-learningUniform Reward=Yes2026.05 | 5 |