Jailbreak Attack on Llama3-8b
0Average ASRPIF
Evaluation Results
| Method | Links | |
|---|---|---|
| PIFAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 0 | |
| PAIRAttacker knowledge (Threat Model)=Fully black-box2025.12 | 0 | |
| L4AAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 0.8 | |
| GCG EnsembleAttacker knowledge (Threat Model)=Fully black-box2025.12 | 0.8 | |
| DI-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 5.8 | |
| DANAttacker knowledge (Threat Model)=Fully black-box2025.12 | 8.6 | |
| SEAAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 10.8 | |
| AutoDan (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 12.2 | |
| GCG (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 12.4 | |
| LSGM_LILA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 13 | |
| TUJA (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 16.4 | |
| Guiding-GCGAttacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 29.8 | |
| SCAV (adaptation)Attacker knowledge (Threat Model)=Pretrain-to-finetune2025.12 | 31.8 | |
| GCG (white)Attacker knowledge (Threat Model)=White-box2025.12 | 38.8 | |
| AutoDan (white)Attacker knowledge (Threat Model)=White-box2025.12 | 48.2 | |
| PGPAttacker knowledge (Threat Model)=Fully black-box2025.12 | 52 |