ResearchDatasetsRandom MDPsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReinforcement LearningRandom MDPs21Sample Complexity (Regret < 0.4)5