ResearchBenchmarksRegret Minimization on KL-regularized Bandits Preference w/ Linear RewardFollow2RegretOnline Iterative GSHF1.91.9522.05Mar 2, 2026Evaluation ResultsMethodMethodLinksRegretSample ComplexityMatches Lower BoundOnline Iterative GSHFType=Upper BoundType=Upper Bound2026.032——