ResearchDatasetsPolicy suboptimality guaranteesFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsInteractive Imitation LearningPolicy suboptimality guarantees1Interaction Rounds I(ε)1