ResearchBenchmarksContent Moderation on Lexica UnsafeBench (test)Follow65Hate Safety ScoreGGuard23.434.24555.8Dec 22, 2025Evaluation ResultsMethodMethodLinksHate Safety ScoreHarassment Safety ScoreViolence Safety ScoreSelf-harm Safety ScoreSexual Safety ScoreShocking Safety ScoreIllegal Activity Safety ScoreDeception Safety ScorePolitical Safety ScoreHealth Safety ScoreSpam Safety ScoreOverall Safety ScoreGGuard2025.126560.670.569.850.660.665.151.173.561.555.962GPT-4VEvaluation Source=Unsa...Evaluation Source=UnsafeBench dataset2025.122563.571.261.382.787.570.142.290.962.117.170.7