Safety Guardrailing on GSM8K
0False Positive RatePerplexity Filter
Evaluation Results
| Method | Links | |
|---|---|---|
| Perplexity FilterBase Model=Llama-3-8B-Instruct2026.04 | 0 | |
| GradSafeBase Model=Llama-3-8B-Instruct2026.04 | 0 | |
| Prompt GuardBase Model=Llama-3-8B-Instruct2026.04 | 0 | |
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 0 | |
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Intent2026.04 | 0 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 0 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 0 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 0 | |
| SelfGraderBase Model=Llama-3-8B-Instruct2026.04 | 0 | |
| Perplexity FilterBackbone=Qwen3.5-9B, Average=0.152026.04 | 0 | |
| GradientCuffBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| Prompt GuardBackbone=Qwen3.5-9B, Average=0.982026.04 | 0 | |
| Llama Guard (Pre)Backbone=Qwen3.5-9B, Average=1.452026.04 | 0 | |
| Llama Guard (Post)Backbone=Qwen3.5-9B, Average=0.432026.04 | 0 | |
| SelfDefend (Intent)Backbone=Qwen3.5-9B, Average=2.332026.04 | 0 | |
| WildGuard (Pre)Backbone=Qwen3.5-9B, Average=3.602026.04 | 0 | |
| WildGuard (Post)Backbone=Qwen3.5-9B, Average=0.182026.04 | 0 | |
| SelfGraderBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Direct2026.04 | 0.06 | |
| GradientCuffBase Model=Llama-3-8B-Instruct2026.04 | 15.33 | |
| SelfDefend (Direct)Backbone=Qwen3.5-9B, Average=7.332026.04 | 70 | |
| Token HighlighterBase Model=Llama-3-8B-Instruct2026.04 | 99.33 |