ResearchDatasetsSixArmsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReinforcement LearningSixArms9.3Cumulative Reward4