Jailbreaking on AdvBench gpt-3.5 (520 malicious intent prompts)
69.9ASRfictional
Evaluation Results
| Method | Links | |
|---|---|---|
| fictionalAbbr.=fic, Pipeline=Single-turn baseline2026.05 | 69.9 | |
| translationAbbr.=tr, Pipeline=Single-turn baseline2026.05 | 24.4 | |
| nshot-hackingAbbr.=ns, Pipeline=Single-turn baseline2026.05 | 19.2 | |
| encryptionAbbr.=enc, Pipeline=Single-turn baseline2026.05 | 17.6 | |
| forced-completionAbbr.=fc, Pipeline=Single-turn baseline2026.05 | 15.5 | |
| cognitive-hackingAbbr.=ch, Pipeline=Single-turn baseline2026.05 | 12.2 | |
| gaslightingAbbr.=gas, Pipeline=Single-turn baseline2026.05 | 9.1 | |
| privilege-escalationAbbr.=pe, Pipeline=Single-turn baseline2026.05 | 5.5 | |
| roleplayAbbr.=rp, Pipeline=Single-turn baseline2026.05 | 3 | |
| paraphrasingAbbr.=pp, Pipeline=Single-turn baseline2026.05 | 0.9 | |
| prompt-injectionAbbr.=pi, Pipeline=Single-turn baseline2026.05 | 0 | |
| obfuscationAbbr.=obs, Pipeline=Single-turn baseline2026.05 | 0 |