Jailbreak Defense on Emoji Attack AutoDAN
2ASRLlama Guard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Llama Guardvariant=Pre, Target LLM=LLama-3-8B Instruct2026.04 | 2 | 95 | |
| SelfDefendvariant=Direct, Target LLM=LLama-3-8B Instruct2026.04 | 2 | 14 | |
| SelfGraderTarget LLM=LLama-3-8B Instruct2026.04 | 0 | 0 |