Jailbreak on WildJailBreak (WJB) (test)
2ASR@1Jailbreak-R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Jailbreak-R1Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 2 | |
| AutoDAN-TurboTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 2.5 | |
| PAIRTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 4 | |
| CrescendoTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 7.5 | |
| MUSE-ATarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 8.5 | |
| MUSE-ATarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 14.73 | |
| CrescendoTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 22.5 | |
| PAIRTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 24 | |
| PAIRTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 31.5 | |
| Jailbreak-R1Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 31.5 | |
| X-TeamingTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 32.5 | |
| X-TeamingTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 34 | |
| ActorAttackTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 35.5 | |
| ActorAttackTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 38 | |
| MUSE-ATarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 40 | |
| ActorAttackTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 41.5 | |
| X-TeamingTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 45 | |
| Jailbreak-R1Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 49 | |
| AutoDAN-TurboTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 50.5 | |
| CrescendoTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 55.5 | |
| SirenTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 57.5 | |
| TROJailTarget Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 63.83 | |
| TROJailTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 66.83 | |
| SirenTarget Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 68 | |
| AutoDAN-TurboTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 73.5 | |
| SirenTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 75 | |
| TROJailTarget Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 77.8 | |
| TRACE (mix)Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 83.17 | |
| TRACE (single)Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 84 | |
| TRACE (single)Target Model=gpt-oss-20b, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 84.17 | |
| TRACE (mix)Target Model=Llama3.1-8B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 88.67 | |
| TRACE (single)Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 89.83 | |
| TRACE (mix)Target Model=Qwen2.5-7B-IT, Evaluation Judge=HarmBench Classifier, Turns=52026.05 | 90.5 |