Reinforcement Learning on episodic finite-horizon linear MDPs
1Dynamic RegretDouble-Restart Q-UCB
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Double-Restart Q-UCBPrior-Free=true2026.04 | 1 | — | — | — | |
| RestartQ-UCBPrior-Free=false2026.04 | 3 | — | — | — | |
| DARLING + UCMQPrior-Free=true2026.04 | 3 | — | — | — | |
| Lower Bound2026.04 | 3 | — | — | — | |
| MASTERPrior-Free=true2026.04 | 3 | — | — | — | |
| DARLING + LSVI-UCB++Prior-Free=true2026.04 | 3 | — | — | — | |
| Lower Bound2026.04 | 3 | — | — | — | |
| LSVI-UCB-RestartPrior-Free=false2026.04 | 4 | — | — | — | |
| MASTERPrior-Free=true2026.04 | 5 | — | — | — | |
| OPT-WLSVIPrior-Free=false2026.04 | 5 | — | — | — | |
| ADA-LSVI-UCB-RestartPrior-Free=true2026.04 | 5 | — | — | — | |
| Liu et al. (2023)Policy Param.=implicit, Clipping Q-Function=yes2026.03 | — | 1 | — | 2 | |
| LMC-NPG-EXPPolicy Param.=explicit, Clipping Q-Function=yes2026.03 | — | 1 | 1 | 2 | |
| Sherman et al. (2023)Policy Param.=implicit, Clipping Q-Function=no2026.03 | — | — | 1 | 2 |