Safety Evaluation on WildJailbreak (test)
0Attack Success Rate (WildJailbreak)SDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SDPOBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k, Selection Protocol=Tier-3 (Full DPO training before selection)2026.06 | 0 | |
| DOG-DBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 3.5 | |
| KMeansBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 5.5 | |
| RandBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 7 | |
| LaserBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 12 | |
| DEITABase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 21 | |
| BaseBase Model=LLaMA3.1-8B, Adaptation Method=LoRA, Selection Budget (K)=30k2026.06 | 51 |