Jailbreak Defense on AdvBench (AutoDAN Attack)
100DSRSmoothLLM
Evaluation Results
| Method | Links | |
|---|---|---|
| SmoothLLMTarget Model=Llama-2-13B2024.02 | 100 | |
| ParaphrasingTarget Model=Llama-2-13B2024.02 | 100 | |
| Response checkTarget Model=Llama-2-13B2024.02 | 100 | |
| BacktranslationTarget Model=GPT-3.5-turbo-03012024.02 | 98 | |
| BacktranslationTarget Model=Llama-2-13B2024.02 | 98 | |
| Response checkTarget Model=GPT-3.5-turbo-03012024.02 | 96 | |
| BacktranslationTarget Model=Vicuna-13B2024.02 | 96 | |
| ParaphrasingTarget Model=GPT-3.5-turbo-03012024.02 | 72 | |
| No defenseTarget Model=GPT-3.5-turbo-03012024.02 | 64 | |
| SmoothLLMTarget Model=GPT-3.5-turbo-03012024.02 | 64 | |
| No defenseTarget Model=Llama-2-13B2024.02 | 40 | |
| ParaphrasingTarget Model=Vicuna-13B2024.02 | 30 | |
| SmoothLLMTarget Model=Vicuna-13B2024.02 | 24 | |
| Response checkTarget Model=Vicuna-13B2024.02 | 12 | |
| No defenseTarget Model=Vicuna-13B2024.02 | 4 |