Defense against adversarial prompts on MMA (test)
0.4Attack Success RateDES
Evaluation Results
| Method | Links | |
|---|---|---|
| DESBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 0.4 | |
| SAGEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 0.5 | |
| AdvUnlearnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 2.1 | |
| SalUnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 3.2 | |
| GLoCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 3.8 | |
| GuardT2IBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 7.54 | |
| ESDBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 8.5 | |
| Latent GuardBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 12.64 | |
| OpenAIBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 24.84 | |
| MicrosoftBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 26.25 | |
| UCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 33.3 | |
| SAFREEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 41.2 | |
| SLD-strongBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 59.2 | |
| SPMBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 65.05 | |
| SDv1.5Base Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 73.93 |