ResearchDatasetsAnthropic Helpful Harmless promptsFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsRLHF Backdoor AttackAnthropic Helpful Harmless prompts (train test)28.1UHR Rate30