Safety Guardrailing on AlpacaEval
0False Positive RateLlama Guard
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0 | |
| GradientCuffBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| SelfGraderBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| Llama Guard (Post)Backbone=Qwen3.5-9B, Average=0.432026.04 | 0.1 | |
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 0.37 | |
| Llama Guard (Pre)Backbone=Qwen3.5-9B, Average=1.452026.04 | 0.4 | |
| WildGuard (Post)Backbone=Qwen3.5-9B, Average=0.182026.04 | 0.4 | |
| GradSafeBase Model=Llama-3-8B-Instruct2026.04 | 0.49 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0.49 | |
| Perplexity FilterBackbone=Qwen3.5-9B, Average=0.152026.04 | 0.6 | |
| Perplexity FilterBase Model=Llama-3-8B-Instruct2026.04 | 0.62 | |
| Prompt GuardBase Model=Llama-3-8B-Instruct2026.04 | 0.62 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Intent2026.04 | 0.74 | |
| Prompt GuardBackbone=Qwen3.5-9B, Average=0.982026.04 | 0.8 | |
| SelfDefend (Intent)Backbone=Qwen3.5-9B, Average=2.332026.04 | 0.9 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0.99 | |
| SelfGraderBase Model=Llama-3-8B-Instruct2026.04 | 1.36 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 1.49 | |
| WildGuard (Pre)Backbone=Qwen3.5-9B, Average=3.602026.04 | 2.7 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 2.73 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Direct2026.04 | 3.72 | |
| SelfDefend (Direct)Backbone=Qwen3.5-9B, Average=7.332026.04 | 4.5 | |
| GradientCuffBase Model=Llama-3-8B-Instruct2026.04 | 24.09 | |
| Token HighlighterBase Model=Llama-3-8B-Instruct2026.04 | 99.25 |