Jailbreak Attack on GCG
96ASRNo Defense
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| No DefenseBackbone=Vicuna2026.02 | 96 | 4.96 | |
| SD_TinyExpertBackbone=Vicuna2026.02 | 92 | 4.9 | |
| No DefenseBase LLM=Vicuna2025.08 | 76 | — | |
| ICDBase LLM=Vicuna2025.08 | 62 | — | |
| SD_DaExpertBackbone=Vicuna2026.02 | 46 | 3.14 | |
| Self-ReminderBackbone=Vicuna2026.02 | 40 | 2.96 | |
| ParaphraseBackbone=Vicuna2026.02 | 38 | 2.92 | |
| Self-ReminderBase LLM=Vicuna2025.08 | 36 | — | |
| SSDBackbone=Vicuna2026.02 | 24 | 2.3 | |
| No DefenseBase LLM=Llama22025.08 | 20 | — | |
| Self-ExamBackbone=Vicuna2026.02 | 12 | 1.58 | |
| Context FilteringBase LLM=Vicuna2025.08 | 12 | — | |
| Self-ExaminationBase LLM=Vicuna2025.08 | 6 | — | |
| Self-ExaminationBase LLM=Llama22025.08 | 6 | — | |
| NGSDBackbone=Vicuna2026.02 | 4 | 1.36 | |
| NGSDBackbone=Llama32026.02 | 2 | 1.14 | |
| SafeDecodingBackbone=Qwen32026.02 | 2 | 1.08 | |
| SD_DaExpertBackbone=Qwen32026.02 | 2 | 1.08 | |
| No DefenseBase LLM=ChatGPT2025.08 | 2 | — | |
| ICDBase LLM=ChatGPT2025.08 | 2 | — | |
| SafeDecodingBackbone=Vicuna2026.02 | 0 | 1.14 | |
| No DefenseBackbone=Llama32026.02 | 0 | 1 | |
| ParaphraseBackbone=Llama32026.02 | 0 | 1.06 | |
| Self-ReminderBackbone=Llama32026.02 | 0 | 1 | |
| Self-ExamBackbone=Llama32026.02 | 0 | 1 | |
| SafeDecodingBackbone=Llama32026.02 | 0 | 1 | |
| SD_TinyExpertBackbone=Llama32026.02 | 0 | 1 | |
| SD_DaExpertBackbone=Llama32026.02 | 0 | 1 | |
| SSDBackbone=Llama32026.02 | 0 | 1 | |
| No DefenseBackbone=Qwen32026.02 | 0 | 1 | |
| ParaphraseBackbone=Qwen32026.02 | 0 | 1.02 | |
| Self-ReminderBackbone=Qwen32026.02 | 0 | 1 | |
| Self-ExamBackbone=Qwen32026.02 | 0 | 1 | |
| SD_TinyExpertBackbone=Qwen32026.02 | 0 | 1 | |
| SSDBackbone=Qwen32026.02 | 0 | 1 | |
| NGSDBackbone=Qwen32026.02 | 0 | 1 | |
| Intention AnalysisBase LLM=Vicuna2025.08 | 0 | — | |
| Safe DecodingBase LLM=Vicuna2025.08 | 0 | — | |
| Self-ReminderBase LLM=Llama22025.08 | 0 | — | |
| ICDBase LLM=Llama22025.08 | 0 | — | |
| Intention AnalysisBase LLM=Llama22025.08 | 0 | — | |
| Safe DecodingBase LLM=Llama22025.08 | 0 | — | |
| Context FilteringBase LLM=Llama22025.08 | 0 | — | |
| Self-ReminderBase LLM=ChatGPT2025.08 | 0 | — | |
| Self-ExaminationBase LLM=ChatGPT2025.08 | 0 | — | |
| Intention AnalysisBase LLM=ChatGPT2025.08 | 0 | — | |
| Context FilteringBase LLM=ChatGPT2025.08 | 0 | — |