Jailbreak Attack Defense on AutoRAN
0Reasoning Failure Rate (FFR)ThinkingI
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ThinkingIModel=R1-Qwen-14B2025.08 | 0 | 68.2 | |
| ReasoningGuardModel=R1-Qwen-14B2025.08 | 0 | 70.5 | |
| ReasoningGuardModel=R1-Qwen-32B2025.08 | 0 | 52.3 | |
| SafeKeyModel=R1-Qwen-14B2025.08 | 2.3 | 70.5 | |
| ThinkingIModel=R1-Qwen-32B2025.08 | 2.3 | 84.1 | |
| RealSafe-R1Model=R1-Qwen-14B2025.08 | 4.5 | 45.5 | |
| RealSafe-R1Model=R1-Qwen-32B2025.08 | 4.5 | 40.9 | |
| SmoothLLMModel=R1-Qwen-14B2025.08 | 6.8 | 68.2 | |
| ParaphraseModel=R1-Qwen-32B2025.08 | 6.8 | 68.2 | |
| SmoothLLMModel=R1-Qwen-32B2025.08 | 9.1 | 68.2 | |
| No DefenseModel=R1-Qwen-14B2025.08 | 11.4 | 84.1 | |
| ParaphraseModel=R1-Qwen-14B2025.08 | 11.4 | 65.9 | |
| Self-ReminderModel=R1-Qwen-14B2025.08 | 11.4 | 70.5 | |
| No DefenseModel=R1-Qwen-32B2025.08 | 11.4 | 75 | |
| SAFEPATH-ZSModel=R1-Qwen-14B2025.08 | 13.6 | 70.5 | |
| SAFEPATH-ZSModel=R1-Qwen-32B2025.08 | 13.6 | 72.7 | |
| Self-ReminderModel=R1-Qwen-32B2025.08 | 15.9 | 84.1 |