ResearchDatasetsAverage-reward MDPsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsAverage-reward Regret MinimizationAverage-reward MDPs1Regret Bound1