GuardReasoner Safety Moderation Landscape
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
GuardReasoner Safety Moderation Landscape (ToxicChat, OpenAI Mod, Aegis, SST, HarmBench, WildGuard, BeaverTails, StrongREJECT-Large, X-Sherpa, X-Refusal) 1:1 per-benchmark (test)
78.2ToxicChat Score
4