Adversarial Attack Robustness on Aggregated Adversarial Attack Datasets
0.4Macro Attack ASRSmoothLLM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SmoothLLMBase Model=Qwen2.5-72B2026.06 | 0.4 | 0.7 | 0.5 | 0.1 | |
| LlamaGuard2Base Model=Qwen2.5-72B2026.06 | 2.6 | 7 | 2.3 | 0.4 | |
| DoubtProbeBase Model=Qwen2.5-72B2026.06 | 3.3 | 12.4 | 0 | 2.5 | |
| Goal PrioritizationBase Model=Qwen2.5-72B2026.06 | 6 | 16.3 | 2.5 | 5.4 | |
| LlamaGuard3Base Model=Qwen2.5-72B2026.06 | 8 | 3.7 | 12.5 | 6.9 | |
| RAINBase Model=Qwen2.5-72B2026.06 | 8.3 | 19.9 | 3.5 | 8.7 | |
| SelfDefend-IntentBase Model=Qwen2.5-72B2026.06 | 8.7 | 18.7 | 3.3 | 11.8 | |
| LlamaGuard4Base Model=Qwen2.5-72B2026.06 | 8.8 | 16.4 | 4 | 13.5 | |
| Self Reminder-OPBase Model=Qwen2.5-72B2026.06 | 9.7 | 19.1 | 5 | 13.1 | |
| Self Reminder-HPBase Model=Qwen2.5-72B2026.06 | 11.4 | 20 | 7.8 | 14.7 | |
| SelfDefend-DirectBase Model=Qwen2.5-72B2026.06 | 14.5 | 19.6 | 14.7 | 13.6 | |
| ICDBase Model=Qwen2.5-72B2026.06 | 20.1 | 21.1 | 18.8 | 29.8 | |
| No defenseBase Model=Qwen2.5-72B2026.06 | 23.7 | 21.4 | 26.3 | 30.2 |