ResearchTasksPrompt ModerationFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedFlexBenchFlexGuard83.99Strict Accuracy16Mar 4, 2026Public Benchmarks for Prompt Moderation ToxicChat, WildGuard, XSTest, OpenAI, Aegis2.0Qwen3Guard-8B-Gen (loose)81.26ToxicChat Score7Mar 4, 2026
Public Benchmarks for Prompt Moderation ToxicChat, WildGuard, XSTest, OpenAI, Aegis2.0Qwen3Guard-8B-Gen (loose)81.26ToxicChat Score7Mar 4, 2026