Benign Prompt Filtering on OR-Bench
0False Positive RatePerplexity Filter
Evaluation Results
| Method | Links | |
|---|---|---|
| Perplexity FilterBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| SelfGraderBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 0.2 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 1.4 | |
| GuardReasonerBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 2.2 | |
| Prompt GuardBase Model=Qwen2.5-7B-Instruct2026.04 | 2.5 | |
| GradientCuffBase Model=Qwen2.5-7B-Instruct2026.04 | 3.5 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 5.4 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Intent2026.04 | 7.4 | |
| GuardReasonerBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 9.6 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 11.7 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Direct2026.04 | 22 |