ResearchTasksPrompt Harmfulness ClassificationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedPublic Prompt Harmfulness Benchmarks (ToxicChat, OpenAI Moderation, AegisSafetyTest, SimpleSafetyTests, HarmBenchPrompt)NemoGuard81OAI Score26May 11, 2026WildGHaloGuard 1.096.2F1 Score22Jul 8, 2026WILDGUARD (test)COLAGUARD89.44F1 Score18May 29, 2026OAIHaloGuard 1.087.4F1 Score10Jul 3, 2026
Public Prompt Harmfulness Benchmarks (ToxicChat, OpenAI Moderation, AegisSafetyTest, SimpleSafetyTests, HarmBenchPrompt)NemoGuard81OAI Score26May 11, 2026