ResearchDatasetsSuboptimal ForwardFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsOffline Reinforcement Learning70% Suboptimal Forward51.19Final Return8