Adversarial Attack Detection on InTheWild
94RecallLlama Prompt Guard 2
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama Prompt Guard 2Model Size=0.086B, Reasoning=false2025.12 | 94 | |
| IBM Granite GuardianVersion=3.1, Model Size=2B, Reasoning=false2025.12 | 87 | |
| Apriel GuardModel Size=8B, Reasoning=false2025.12 | 87 | |
| Apriel GuardModel Size=8B, Reasoning=true2025.12 | 86 | |
| Qwen3GuardModel Size=8B, Constraint=strict, Reasoning=false2025.12 | 85 | |
| IBM Granite GuardianVersion=3.2, Model Size=3B, Reasoning=false2025.12 | 80 | |
| IBM Granite GuardianVersion=3.2, Model Size=5B, Reasoning=false2025.12 | 79 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=false2025.12 | 77 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=true2025.12 | 69 | |
| Qwen3GuardModel Size=8B, Constraint=loose, Reasoning=false2025.12 | 67 | |
| gpt-oss-safeguardModel Size=20B, Reasoning=true2025.12 | 61 | |
| Llama GuardVersion=4, Reasoning=false2025.12 | 43 | |
| Llama GuardVersion=3, Reasoning=false2025.12 | 27 | |
| ShieldGemmaModel Size=9B, Reasoning=false2025.12 | 21 | |
| Llama GuardVersion=2, Reasoning=false2025.12 | 12 |