ResearchDatasetsAverage-reward MDPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsMulti-objective Reinforcement LearningAverage-reward MDP1Sample Complexity Bound5