Jailbreak Attack on Llama2-7b five finetuned variants
0Average ASRPIF
Evaluation Results
| Method | Links | |
|---|---|---|
| PIFAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 0 | |
| DANAttacker knowledge (Threat Model)=Fully black-box2025.12 | 0 | |
| PAIRAttacker knowledge (Threat Model)=Fully black-box2025.12 | 0 | |
| L4AAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 1.8 | |
| DI-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 3.2 | |
| AutoDan (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 6.2 | |
| AutoDan (white)Attacker knowledge (Threat Model)=White-box2025.12 | 15.8 | |
| LSGM_LILA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 16 | |
| SEAAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 20.4 | |
| TUJA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 24.8 | |
| GCG (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 25.6 | |
| SCAV (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 28 | |
| Guiding-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 33.2 | |
| GCG EnsembleAttacker knowledge (Threat Model)=Fully black-box2025.12 | 40.2 | |
| GCG (white)Attacker knowledge (Threat Model)=White-box2025.12 | 47.4 | |
| PGPAttacker knowledge (Threat Model)=Fully black-box2025.12 | 62.6 |