Jailbreak Defense on AdvBench PAD
12.12ASRLLaDA-1.5 + Self-reminder + DIFFUGUARD
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaDA-1.5 + Self-reminder + DIFFUGUARDBase Model=LLaDA-1.5, Defense Method=Self-reminder + DIFFUGUARD2025.09 | 12.12 | |
| LLaDA-1.5 + Self-reminderBase Model=LLaDA-1.5, Defense Method=Self-reminder2025.09 | 15 | |
| LLaDA + DIFFUGUARDdefense=DIFFUGUARD2025.09 | 17.12 | |
| Dream + DIFFUGUARDdefense=DIFFUGUARD2025.09 | 19.42 | |
| LLaDA-8B-Instruct + Self-reminder + DIFFUGUARDBase Model=LLaDA-8B-Instruct, Defense Method=Self-reminder + DIFFUGUARD2025.09 | 24.42 | |
| LLaDA-8B w/ DIFFUGUARDAttack Scenario=Standard2025.09 | 24.42 | |
| LLaDA-8B-Instruct + Self-reminderBase Model=LLaDA-8B-Instruct, Defense Method=Self-reminder2025.09 | 30.58 | |
| Dream-v0-Instruct-7B + DIFFUGUARDBase Model=Dream-v0-Instruct-7B, Defense Method=DIFFUGUARD2025.09 | 31.15 | |
| LLaDA-8B w/ DIFFUGUARDAttack Scenario=Multi-sampling2025.09 | 35.96 | |
| Dream-v0-Instruct-7B + Self-reminder + DIFFUGUARDBase Model=Dream-v0-Instruct-7B, Defense Method=Self-reminder + DIFFUGUARD2025.09 | 37.31 | |
| Dream-7B w/ DIFFUGUARDAttack Scenario=Standard2025.09 | 37.31 | |
| MMaDA-8B-MixCoT + Self-reminder + DIFFUGUARDBase Model=MMaDA-8B-MixCoT, Defense Method=Self-reminder + DIFFUGUARD2025.09 | 37.69 | |
| Dream-7B w/ DIFFUGUARDAttack Scenario=Multi-sampling2025.09 | 40.38 | |
| LLaDA-8B w/ DIFFUGUARDAttack Scenario=Gradient-based2025.09 | 44.42 | |
| LLaDA-1.5 + DIFFUGUARDBase Model=LLaDA-1.5, Defense Method=DIFFUGUARD2025.09 | 56.15 | |
| LLaDA-8B-Instruct + DIFFUGUARDBase Model=LLaDA-8B-Instruct, Defense Method=DIFFUGUARD2025.09 | 59.62 | |
| MMaDA-8B-MixCoT + DIFFUGUARDBase Model=MMaDA-8B-MixCoT, Defense Method=DIFFUGUARD2025.09 | 61.54 | |
| LLaDA-8B w/ DIFFUGUARDAttack Scenario=Threshold-probing2025.09 | 65.58 | |
| Dream-7B w/ DIFFUGUARDAttack Scenario=Gradient-based2025.09 | 65.96 | |
| Dream2025.09 | 70.38 | |
| LLaDA-1.5 + PPL-FilterBase Model=LLaDA-1.5, Defense Method=PPL-Filter2025.09 | 74.42 | |
| MMaDA-8B-MixCoT + Self-reminderBase Model=MMaDA-8B-MixCoT, Defense Method=Self-reminder2025.09 | 78.08 | |
| Dream-7B w/ DIFFUGUARDAttack Scenario=Threshold-probing2025.09 | 84.62 | |
| LLaDA-8B-Instruct + PPL-FilterBase Model=LLaDA-8B-Instruct, Defense Method=PPL-Filter2025.09 | 85.96 | |
| MMaDA-8B-MixCoT + PPL-FilterBase Model=MMaDA-8B-MixCoT, Defense Method=PPL-Filter2025.09 | 86.15 | |
| LLaDA2025.09 | 86.54 | |
| LLaDA-1.5Base Model=LLaDA-1.5, Defense Method=None2025.09 | 87.69 | |
| LLaDA-8BAttack Scenario=Gradient-based2025.09 | 88.27 | |
| LLaDA-8B-InstructBase Model=LLaDA-8B-Instruct, Defense Method=None2025.09 | 93.65 | |
| LLaDA-8BAttack Scenario=Standard2025.09 | 93.65 | |
| Dream-v0-Instruct-7B + PPL-FilterBase Model=Dream-v0-Instruct-7B, Defense Method=PPL-Filter2025.09 | 94.04 | |
| Dream-7BAttack Scenario=Gradient-based2025.09 | 95.96 | |
| Dream-7BAttack Scenario=Threshold-probing2025.09 | 98.27 | |
| Dream-v0-Instruct-7B + Self-reminderBase Model=Dream-v0-Instruct-7B, Defense Method=Self-reminder2025.09 | 98.65 | |
| LLaDA-8BAttack Scenario=Threshold-probing2025.09 | 98.84 | |
| LLaDA-8BAttack Scenario=Multi-sampling2025.09 | 98.85 | |
| Dream-v0-Instruct-7BBase Model=Dream-v0-Instruct-7B, Defense Method=None2025.09 | 99.23 | |
| MMaDA-8B-MixCoTBase Model=MMaDA-8B-MixCoT, Defense Method=None2025.09 | 99.23 | |
| Dream-7BAttack Scenario=Standard2025.09 | 99.23 | |
| Dream-7BAttack Scenario=Multi-sampling2025.09 | 100 |