ResearchDatasetsChain MDPFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReinforcement LearningChain MDP61.81Scaled Mean Cumulative Reward5