Adversarial Attack Detection on Gandalf
1RecallLlama Prompt Guard 2
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama Prompt Guard 2Model Size=0.086B, Reasoning=false2025.12 | 1 | |
| Apriel GuardModel Size=8B, Reasoning=false2025.12 | 0.91 | |
| Apriel GuardModel Size=8B, Reasoning=true2025.12 | 0.91 | |
| IBM Granite GuardianVersion=3.2, Model Size=3B, Reasoning=false2025.12 | 0.7 | |
| Qwen3GuardModel Size=8B, Constraint=strict, Reasoning=false2025.12 | 0.69 | |
| gpt-oss-safeguardModel Size=20B, Reasoning=true2025.12 | 0.63 | |
| IBM Granite GuardianVersion=3.1, Model Size=2B, Reasoning=false2025.12 | 0.52 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=false2025.12 | 0.47 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=true2025.12 | 0.44 | |
| IBM Granite GuardianVersion=3.2, Model Size=5B, Reasoning=false2025.12 | 0.41 | |
| Llama GuardVersion=3, Reasoning=false2025.12 | 0.27 | |
| Llama GuardVersion=2, Reasoning=false2025.12 | 0.26 | |
| Llama GuardVersion=4, Reasoning=false2025.12 | 0.23 | |
| Qwen3GuardModel Size=8B, Constraint=loose, Reasoning=false2025.12 | 0.02 | |
| ShieldGemmaModel Size=9B, Reasoning=false2025.12 | 0 |