Jailbreak Defense on AdvBench (GCG Attack)
100DSRSmoothLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| SmoothLLMTarget Model=GPT-3.5-turbo2024.02 | 100 | |
| ParaphrasingTarget Model=GPT-3.5-turbo2024.02 | 100 | |
| BacktranslationTarget Model=GPT-3.5-turbo2024.02 | 100 | |
| Response checkTarget Model=Llama-2-13B2024.02 | 100 | |
| BacktranslationTarget Model=Llama-2-13B2024.02 | 100 | |
| SmoothLLMTarget Model=Llama-2-13B2024.02 | 98 | |
| ParaphrasingTarget Model=Llama-2-13B2024.02 | 98 | |
| BacktranslationTarget Model=Vicuna-13B2024.02 | 98 | |
| No defenseTarget Model=GPT-3.5-turbo2024.02 | 94 | |
| Response checkTarget Model=GPT-3.5-turbo2024.02 | 94 | |
| SmoothLLMTarget Model=Vicuna-13B2024.02 | 92 | |
| ParaphrasingTarget Model=Vicuna-13B2024.02 | 84 | |
| No defenseTarget Model=Llama-2-13B2024.02 | 66 | |
| Response checkTarget Model=Vicuna-13B2024.02 | 30 | |
| No defenseTarget Model=Vicuna-13B2024.02 | 8 |