Benign Prompt Filtering on AlpacaEval
0False Positive RateGradientCuff
Evaluation Results
| Method | Links | |
|---|---|---|
| GradientCuffBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 0 | |
| SelfGraderBase Model=Qwen2.5-7B-Instruct2026.04 | 0 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Post2026.04 | 0.2 | |
| Llama GuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 0.4 | |
| Perplexity FilterBase Model=Qwen2.5-7B-Instruct2026.04 | 0.6 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Intent2026.04 | 0.7 | |
| Prompt GuardBase Model=Qwen2.5-7B-Instruct2026.04 | 0.8 | |
| WildGuardBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Pre2026.04 | 2.7 | |
| SelfDefendBase Model=Qwen2.5-7B-Instruct, Guardrail Stage/Mode=Direct2026.04 | 3.9 |