Safety Evaluation on AutoDAN (test)
0Attack Success Rate (AD)SDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SDPOBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k, Selection Protocol=Tier-3 (Full DPO training before selection)2026.06 | 0 | |
| DOG-DBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 0.2 | |
| LaserBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 2.3 | |
| RandBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 6.5 | |
| KMeansBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 7.7 | |
| DEITABase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 24.4 | |
| BaseBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 81.7 |