Jailbreak Defense on Emoji Attack Average
0.36ASRSelfGrader
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SelfGraderTarget LLM=LLama-3-8B Instruct2026.04 | 0.36 | 2.18 | |
| SelfDefendvariant=Direct, Target LLM=LLama-3-8B Instruct2026.04 | 3.76 | 43.06 | |
| Llama Guardvariant=Pre, Target LLM=LLama-3-8B Instruct2026.04 | 6.72 | 90.48 |