Jailbreak Attack on DeepSeek-7b five finetuned variants
3.8Average ASRL4A
Evaluation Results
| Method | Links | |
|---|---|---|
| L4AAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 3.8 | |
| LSGM_LILA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 11 | |
| DANAttacker knowledge (Threat Model)=Fully black-box2025.12 | 11.6 | |
| DI-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 14.4 | |
| GCG (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 23 | |
| GCG EnsembleAttacker knowledge (Threat Model)=Fully black-box2025.12 | 24.4 | |
| PIFAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 27.4 | |
| SEAAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 45.8 | |
| GCG (white)Attacker knowledge (Threat Model)=White-box2025.12 | 50.4 | |
| Guiding-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 53.8 | |
| TUJA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 59.2 | |
| PAIRAttacker knowledge (Threat Model)=Fully black-box2025.12 | 67 | |
| SCAV (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 71.4 | |
| AutoDan (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 86.6 | |
| PGPAttacker knowledge (Threat Model)=Fully black-box2025.12 | 87 | |
| AutoDan (white)Attacker knowledge (Threat Model)=White-box2025.12 | 100 |