ResearchDatasetsToy MDPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsModel-free learningToy 3-arm MDP1Regret (T-dependence)1