ResearchDatasetsRay MazeFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsCumulative Reward MaximizationRay Maze0.47Mean Cumulative Reward5