ResearchTasksPolicy learning from action-inclusive feedbackFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedOpenML (K ≥ 3, N ≥ 70,000)CB Policy58.41Policy Accuracy3Feb 26, 2026OpenML K ≥ 3CB Policy57.98Policy Accuracy3Feb 26, 2026