Content Safety Detection on Do-Not-Answer
96.4F1 Scoreprompt–response verification framework
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| prompt–response verification framework2026.06 | 96.4 | 3.1 | |
| WildGuard / ShieldGemmaType=Strongest Applicable Baseline2026.06 | 90.4 | — |