ResearchDatasetsHHAFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsReward ScoringHHA benchmark66.97Harmlessness Score (Base)30Alignment Reward EvaluationHHA (test)64Harmless Score20RLHF Alignment EvaluationHHA76.1Harmlessness Win Rate (Base, A)6