Jailbreaking on AdvBench-50
0Unsafe Interaction RateMSJ
Evaluation Results
| Method | Links | |
|---|---|---|
| MSJTarget Model=GPT-4.1, Configuration=64-shot2026.03 | 0 | |
| LACETarget Model=GPT-4.1, Encoding Scheme=Word Substitution Cipher combined with Word Reversal2026.03 | 18 | |
| AutoDAN-TurboTarget Model=GPT-4.1, Attacker Model=DeepSeek-V3.2-Exp (thinking mode)2026.03 | 90 | |
| malicious finetuning via steganographyTarget Model=GPT-4.1, Decoding Status=after decoding2026.03 | 96 |