Adversarial Attack Defense on GCG Individual
100BARPerplexity Defense
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Perplexity DefenseModel=Guanaco-7B-HF2023.09 | 100 | 4 | — | |
| Vicuna-7B-chat-HFAlignment=Original LLM2023.09 | 99.3 | 98.7 | — | |
| Original LLMModel=Vicuna-7B-chat-HF2023.09 | 99.3 | 98.7 | — | |
| Original LLMBackbone=Vicuna-7B-chat-HF, Defense=None2023.09 | 99.3 | 98.7 | — | |
| Vicuna-7B-chat-HFAlignment=RA-LLM2023.09 | 98.7 | 10.7 | 88 | |
| RA-LLMModel=Vicuna-7B-chat-HF2023.09 | 98.7 | 10.7 | — | |
| RA-LLMBackbone=Vicuna-7B-chat-HF2023.09 | 98.7 | 10.7 | — | |
| Perplexity DefenseModel=Vicuna-7B-chat-HF2023.09 | 98 | 0 | — | |
| Guanaco-7B-HFAlignment=Original LLM2023.09 | 95.3 | 96 | — | |
| Original LLMModel=Guanaco-7B-HF2023.09 | 95.3 | 96 | — | |
| Original LLMBackbone=Guanaco-7B-HF, Defense=None2023.09 | 95.3 | 96 | — | |
| Guanaco-7B-HFAlignment=RA-LLM2023.09 | 92 | 6.7 | 89.3 | |
| RA-LLMModel=Guanaco-7B-HF2023.09 | 92 | 6.7 | — | |
| RA-LLMBackbone=Guanaco-7B-HF2023.09 | 92 | 6.7 | — | |
| LLM Self DefenseBackbone=Vicuna-7B-chat-HF, Verifier=GPT-3.52023.09 | 90 | 8 | — | |
| LLM Self DefenseBackbone=Guanaco-7B-HF, Verifier=GPT-3.52023.09 | 87.3 | 8.7 | — | |
| LLM Self DefenseBackbone=Vicuna-7B-chat-HF, Verifier=Self (Questions as suffix)2023.09 | 68.7 | 22.7 | — | |
| LLM Self DefenseBackbone=Guanaco-7B-HF, Verifier=Self (Questions as suffix)2023.09 | 41.3 | 52 | — |