Defense against adversarial prompts on Ring-A-Bell (test)
0Attack Success RateGLoCE
Evaluation Results
| Method | Links | |
|---|---|---|
| GLoCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 0 | |
| AdvUnlearnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 0.93 | |
| DESBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 0.93 | |
| SAGEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 1.87 | |
| GuardT2IBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 3.1 | |
| SalUnBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 3.74 | |
| OpenAIBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 19.26 | |
| UCEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 21.5 | |
| ESDBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 26.17 | |
| Latent GuardBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 43.1 | |
| MicrosoftBase Model=SDv1.5, Evaluation Classifier=filtering accuracy2026.07 | 44.02 | |
| SAFREEBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 76.64 | |
| SPMBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 91.59 | |
| SLD-strongBase Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 97.2 | |
| SDv1.5Base Model=SDv1.5, Evaluation Classifier=NudeNet2026.07 | 98.13 |