Jailbreak and Phishing Prompt Classification on 60 Malicious Queries
92Accuracy (Jailbreak/Phishing)Xu et al.
Evaluation Results
| Method | Links | |
|---|---|---|
| Xu et al.Attack Vectors=Jailbreaking but not specific to phishing, Models=Vicuna, Llama, GPT-3.5, Best Model=Bergeron the immune system and RoBERTa Classifier2025.07 | 92 |