Benign Prompt Filtering on HumanEval
0False Positive RatePerplexity Filter
Evaluation Results
| Method | Links | |
|---|---|---|
| Perplexity FilterBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| GradientCuffBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 0 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 0 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Intent2026.04 | 0 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 0 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 0 | |
| SelfGraderBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| Prompt GuardBase Model=Qwen2.5-7B-Instruct2026.04 | 0.6 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Direct2026.04 | 1.8 |