ResearchDatasetsHH-HarmlessFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReward Hacking MitigationExcessive HH Harmless 1.0 (Evaluation)8.2Reference Error Rate10Preference EvaluationHH-Harmless60Win Rate8LLM AlignmentHH-Harmless (test)59Win Rate2