Prompt Injection and Jailbreak Detection on EIA
100RecallGPT-5.4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.4Model Category=Closed-source API2026.05 | 100 | |
| Claude-Sonnet-4.6Model Category=Closed-source API2026.05 | 100 | |
| Claude-Haiku-4.5Model Category=Closed-source API2026.05 | 100 | |
| Gemma-4-31BModel Category=Open-source instructed model2026.05 | 100 | |
| WARD-0.8bModel Category=Ours2026.05 | 100 | |
| WARD-2bModel Category=Ours2026.05 | 100 | |
| Gemini-3-FlashModel Category=Closed-source API2026.05 | 99.93 | |
| PromptArmorModel Category=Guard model (Prompt Injection)2026.05 | 99.01 | |
| GPT-5.4-MiniModel Category=Closed-source API2026.05 | 97.45 | |
| Gemma-3-4BModel Category=Open-source instructed model2026.05 | 96.96 | |
| WebAgentGuard-4bModel Category=Guard model (Prompt Injection)2026.05 | 95.47 | |
| Gemini-3.1-proModel Category=Closed-source API2026.05 | 95.33 | |
| BrowseSafeModel Category=Guard model (Prompt Injection)2026.05 | 94.77 | |
| Qwen3.5-35B-A3BModel Category=Open-source instructed model2026.05 | 88.68 | |
| WebAgentGuard-8bModel Category=Guard model (Prompt Injection)2026.05 | 84.72 | |
| Qwen-3.5-2BModel Category=Open-source instructed model2026.05 | 83.38 | |
| Qwen-3.5-4BModel Category=Open-source instructed model2026.05 | 80.69 | |
| Qwen-3.5-0.8BModel Category=Open-source instructed model2026.05 | 78.71 | |
| SuperAgent-Guard-4bModel Category=Guard model (Prompt Injection)2026.05 | 61.67 | |
| DataSentinelModel Category=Guard model (Prompt Injection)2026.05 | 56.65 | |
| Llama-Guard-4-12BModel Category=Guard model (Jail Break)2026.05 | 25.04 | |
| SuperAgent-Guard-1.7bModel Category=Guard model (Prompt Injection)2026.05 | 19.38 | |
| Prompt-Guard-1-86MModel Category=Guard model (Jail Break)2026.05 | 12.45 | |
| GPT-Oss-Safeguard-20bModel Category=Guard model (Jail Break)2026.05 | 6.65 | |
| Prompt-Guard-2-86MModel Category=Guard model (Jail Break)2026.05 | 0.85 |