Content Safety Detection on StrongReject
95.8F1 Scoreprompt–response verification framework
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| prompt–response verification framework2026.06 | 95.8 | 4.2 | |
| AutoDefense / SelfDefendType=Strongest Applicable Baseline2026.06 | 92.5 | — |