Jailbreak on JailbreakBench (original split)
95.15ASR@1TRACE (single)
Evaluation Results
| Method | Links | |
|---|---|---|
| TRACE (single)Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 95.15 | |
| TRACE (mix)Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 89.09 | |
| TRACE (mix)Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 87.72 | |
| TRACE (mix)Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 86.06 | |
| TRACE (single)Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 84.24 | |
| TROJailTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 81.13 | |
| TRACE (single)Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 76.97 | |
| TROJailTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 73.94 | |
| SirenTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 70.03 | |
| AutoDAN-TurboTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 69.09 | |
| SirenTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 61.21 | |
| TROJailTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 56.37 | |
| SirenTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 48.48 | |
| CrescendoTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 47.88 | |
| AutoDAN-TurboTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 45.45 | |
| MUSE-ATarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 41.82 | |
| ActorAttackTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 41.81 | |
| X-TeamingTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 41.81 | |
| ActorAttackTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 40 | |
| X-TeamingTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 36.36 | |
| Jailbreak-R1Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 34.54 | |
| X-TeamingTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 34.54 | |
| Jailbreak-R1Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 27.27 | |
| ActorAttackTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 27.27 | |
| PAIRTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 23.36 | |
| PAIRTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 20 | |
| CrescendoTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 20 | |
| MUSE-ATarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 13.73 | |
| CrescendoTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 7.27 | |
| PAIRTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 5.45 | |
| AutoDAN-TurboTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 5.45 | |
| Jailbreak-R1Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 5.45 | |
| MUSE-ATarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 0 |