Adversarial Robustness on AutoDAN
0ASRParaphrase
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ParaphraseModel=Llama2-7b2026.02 | 0 | 1.06 | |
| Self-ExamModel=Llama2-7b2026.02 | 0 | 1 | |
| Self-ReminderModel=Llama2-7b2026.02 | 0 | 1.06 | |
| SD_DaExpertModel=Llama2-7b2026.02 | 0 | 1 | |
| SSDModel=Llama2-7b2026.02 | 0 | 1 | |
| NGSDModel=Llama2-7b2026.02 | 0 | 1 | |
| No DefenseModel=Llama2-13b2026.02 | 0 | 1.06 | |
| ParaphraseModel=Llama2-13b2026.02 | 0 | 1.3 | |
| Self-ExamModel=Llama2-13b2026.02 | 0 | 1 | |
| Self-ReminderModel=Llama2-13b2026.02 | 0 | 1 | |
| SD_TinyExpertModel=Llama2-13b2026.02 | 0 | 1.02 | |
| NGSDModel=Llama2-13b2026.02 | 0 | 1.08 | |
| SafeDecodingModel=Llama2-7b2026.02 | 2 | 1.14 | |
| SafeDecodingModel=Llama2-13b2026.02 | 2 | 1.16 | |
| SD_DaExpertModel=Llama2-13b2026.02 | 2 | 1.1 | |
| SSDModel=Llama2-13b2026.02 | 2 | 1.12 | |
| SD_TinyExpertModel=Llama2-7b2026.02 | 4 | 1.16 | |
| No DefenseModel=Llama2-7b2026.02 | 8 | 1.32 |