ResearchDatasetsSuboptimal BackwardFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsOffline Reinforcement Learning70% Suboptimal Backward49.6Final Return8