ResearchDatasetsCheckpoint-basedFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsBandit Regret MinimizationCheckpoint-based (evaluation)427.7Mean Difference5