Content Safety Detection on HarmBench cyber
92.8F1 Scoreprompt–response verification framework
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| prompt–response verification framework2026.06 | 92.8 | 4.7 | |
| Single-Agent+CoTType=Strongest Applicable Baseline2026.06 | 85.6 | — |
| Method | Links | ||
|---|---|---|---|
| prompt–response verification framework2026.06 | 92.8 | 4.7 | |
| Single-Agent+CoTType=Strongest Applicable Baseline2026.06 | 85.6 | — |