Loading the SOTA2 catalog…
Variance-Adaptive Optimal Algorithm for Reinforcement Learning with Multinomial Logit Function Approximation · SOTA2 Research