ResearchTasksRLHF Backdoor AttackFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedAnthropic Helpful Harmless prompts (train test)Random28.1UHR Rate30Jun 2, 2026