Jailbreak Detection on ChatGPT Jailbreak Prompts
100RecallLlama Prompt Guard 2
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama Prompt Guard 2Model Size=0.086B, Reasoning=false2025.12 | 100 | |
| IBM Granite GuardianVersion=3.1, Model Size=2B, Reasoning=false2025.12 | 100 | |
| Qwen3GuardModel Size=8B, Constraint=strict, Reasoning=false2025.12 | 100 | |
| Apriel GuardModel Size=8B, Reasoning=false2025.12 | 100 | |
| Apriel GuardModel Size=8B, Reasoning=true2025.12 | 100 | |
| IBM Granite GuardianVersion=3.2, Model Size=5B, Reasoning=false2025.12 | 97 | |
| IBM Granite GuardianVersion=3.2, Model Size=3B, Reasoning=false2025.12 | 96 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=false2025.12 | 91 | |
| Qwen3GuardModel Size=8B, Constraint=loose, Reasoning=false2025.12 | 89 | |
| IBM Granite GuardianVersion=3.3, Model Size=8B, Reasoning=true2025.12 | 86 | |
| gpt-oss-safeguardModel Size=20B, Reasoning=true2025.12 | 82 | |
| Llama GuardVersion=4, Reasoning=false2025.12 | 49 | |
| Llama GuardVersion=3, Reasoning=false2025.12 | 28 | |
| ShieldGemmaModel Size=9B, Reasoning=false2025.12 | 8 | |
| Llama GuardVersion=2, Reasoning=false2025.12 | 0 |