Defense against adversarial prompts on P4D (test)
1.1Attack Success RateAdvUnlearn
Evaluation Results
| Method | Links | |
|---|---|---|
| AdvUnlearnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 1.1 | |
| DESBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 1.1 | |
| SAGEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 1.1 | |
| SalUnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 5.15 | |
| GLoCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 5.51 | |
| GuardT2IBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 8.31 | |
| ESDBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 26.1 | |
| UCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 33.09 | |
| Latent GuardBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 47.11 | |
| SAFREEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 48.9 | |
| OpenAIBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 58.98 | |
| SLD-strongBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 62.5 | |
| SPMBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 71.32 | |
| MicrosoftBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 72.24 | |
| SDv1.5Base Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 94.93 |