Safety Evaluation on AdvBench & SorryBench
41.6Avg Success Rate (Reasoning Path)No Defense
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| No DefenseBackbone=R1-Qwen-7B, Defense Strategy=None2025.08 | 41.6 | 59.2 | |
| PPLBackbone=R1-Qwen-7B, Defense Strategy=Input-level Filtering2025.08 | 41.6 | 59.2 | |
| No DefenseBackbone=R1-Llama-8B, Defense Strategy=None2025.08 | 40.3 | 48.5 | |
| PPLBackbone=R1-Llama-8B, Defense Strategy=Input-level Filtering2025.08 | 40.3 | 48.5 | |
| Llama Guard 3Backbone=R1-Llama-8B, Defense Strategy=Post-hoc Guard Model2025.08 | 14.6 | 27.1 | |
| Llama Guard 3Backbone=R1-Qwen-7B, Defense Strategy=Post-hoc Guard Model2025.08 | 10.2 | 32.3 | |
| GuardReasonerBackbone=R1-Llama-8B, Defense Strategy=Post-hoc Guard Model2025.08 | 10.2 | 22.7 | |
| GuardReasonerBackbone=R1-Qwen-7B, Defense Strategy=Post-hoc Guard Model2025.08 | 9 | 23.5 | |
| ReasoningGuardBackbone=R1-Llama-8B, Defense Strategy=Proactive Reasoning Guard2025.08 | 1.1 | 8 | |
| ReasoningGuard + LGBackbone=R1-Llama-8B, Defense Strategy=Hybrid2025.08 | 1.1 | 6.8 | |
| ReasoningGuard + GRBackbone=R1-Llama-8B, Defense Strategy=Hybrid2025.08 | 1.1 | 8 | |
| ReasoningGuardBackbone=R1-Qwen-7B, Defense Strategy=Proactive Reasoning Guard2025.08 | 1 | 7.8 | |
| ReasoningGuard + LGBackbone=R1-Qwen-7B, Defense Strategy=Hybrid2025.08 | 0 | 6.8 | |
| ReasoningGuard + GRBackbone=R1-Qwen-7B, Defense Strategy=Hybrid2025.08 | 0 | 6.8 |