ResearchBenchmarksModel-free learning on Toy 3-arm MDPFollow1Regret (T-dependence)Dig-DEC0.950.97511.025Oct 10, 2025Evaluation ResultsMethodMethodLinksRegret (T-dependence)Dig-DECExploration Mechanism=...Exploration Mechanism=information gain2025.101