Safety Guardrailing on OR-Bench
0False Positive RatePerplexity Filter
Evaluation Results
| Method | Links | |
|---|---|---|
| Perplexity FilterBase Model=Llama-3-8B-Instruct2026.04 | 0 | |
| Perplexity FilterBackbone=Qwen3.5-9B, Average=0.152026.04 | 0 | |
| GradientCuffBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| SelfGraderBackbone=Qwen3.5-9B, Average=0.002026.04 | 0 | |
| WildGuard (Post)Backbone=Qwen3.5-9B, Average=0.182026.04 | 0.3 | |
| GuardReasoner (Post)Backbone=Qwen3.5-9B2026.04 | 0.6 | |
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 1 | |
| Llama Guard (Post)Backbone=Qwen3.5-9B, Average=0.432026.04 | 1.6 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 2 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Post-checking2026.04 | 2.2 | |
| Prompt GuardBase Model=Llama-3-8B-Instruct2026.04 | 2.5 | |
| Prompt GuardBackbone=Qwen3.5-9B, Average=0.982026.04 | 2.5 | |
| WildGuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 3.1 | |
| GradSafeBase Model=Llama-3-8B-Instruct2026.04 | 3.2 | |
| Llama GuardBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 5.4 | |
| Llama Guard (Pre)Backbone=Qwen3.5-9B, Average=1.452026.04 | 5.4 | |
| SelfGraderBase Model=Llama-3-8B-Instruct2026.04 | 6.3 | |
| SelfDefend (Intent)Backbone=Qwen3.5-9B, Average=2.332026.04 | 8.4 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Intent2026.04 | 8.8 | |
| GuardReasonerBase Model=Llama-3-8B-Instruct, Guardrail Stage=Pre-checking2026.04 | 9.6 | |
| GuardReasoner (Pre)Backbone=Qwen3.5-9B2026.04 | 9.6 | |
| GradientCuffBase Model=Llama-3-8B-Instruct2026.04 | 10 | |
| WildGuard (Pre)Backbone=Qwen3.5-9B, Average=3.602026.04 | 11.7 | |
| SelfDefendBase Model=Llama-3-8B-Instruct, Defense Mode=Direct2026.04 | 21 | |
| SelfDefend (Direct)Backbone=Qwen3.5-9B, Average=7.332026.04 | 22.3 | |
| Token HighlighterBase Model=Llama-3-8B-Instruct2026.04 | 98.2 |