ResearchDatasetspenFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsOff-policy evaluation for classification errorpen-0.095Bias15Offline-to-online Reinforcement Learningpen5.3Regret12Trojan Attack (Target action: 'fixed random')Pen100Attack Success Rate (ASR)9Trojan Attack (Target action: 'arithmetic')Pen0ASR9Trojan Attack (Target action: '1')Pen100ASR9Reinforcement Learningpen human53.4Normalized Return4Reinforcement Learningpen cloned58.9Normalized Return4