ResearchDatasetsSimulation BlocksFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsOff-policy learningSimulation Blocks 2-5 Cross-block averages0.722Average Value7