Jailbreak Defense on Manual (IJP)
0ASRPrompt Guard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Prompt GuardLatency (Sec.)=15.11, Memory Overhead (MB)=1064.732026.04 | 0 | 0 | |
| Prompt GuardLatency (Sec.)=16.87, Memory Overhead (MB)=1064.712026.04 | 0 | 0 | |
| Prompt GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=8.48, Memory Overhead (MB)=1154.582026.04 | 0 | 0 | |
| WildGuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=1.00, Memory Overhead (MB)=13939.25, Evaluation Stage=Pre2026.04 | 0 | 3.4 | |
| GuardReasonerBackbone=Qwen2.5-7B-Instruct, Evaluation Stage=Pre2026.04 | 0 | 0.9 | |
| SelfGraderBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=1.33, Memory Overhead (MB)=374.252026.04 | 0 | 0 | |
| SelfGraderTarget LLM=LLama-3-8B Instruct2026.04 | 0.2 | 9.1 | |
| WildGuard (Pre)Latency (Sec.)=2.74, Memory Overhead (MB)=28014.702026.04 | 0.4 | 3.3 | |
| SelfGraderLatency (Sec.)=0.78, Memory Overhead (MB)=377.612026.04 | 0.5 | 6.3 | |
| GradientCuffLatency (Sec.)=19.26, Memory Overhead (MB)=1223.192026.04 | 0.8 | 3.6 | |
| GuardReasoner (Pre)Latency (Sec.)=11.90, Memory Overhead (MB)=15317.412026.04 | 0.9 | 7.8 | |
| SelfDefendvariant=Direct, Target LLM=LLama-3-8B Instruct2026.04 | 0.9 | 27 | |
| SelfDefendBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.64, Memory Overhead (MB)=13130.75, Mode=Direct2026.04 | 1.7 | 25.3 | |
| GuardReasonerBackbone=Qwen2.5-7B-Instruct, Evaluation Stage=Post2026.04 | 1.8 | 51.9 | |
| SelfDefend (Direct)Latency (Sec.)=0.80, Memory Overhead (MB)=13241.862026.04 | 2 | 28.9 | |
| SelfDefend (Intent)Latency (Sec.)=2.38, Memory Overhead (MB)=13247.352026.04 | 2 | 25.7 | |
| WildGuard (Post)Latency (Sec.)=2.78, Memory Overhead (MB)=28098.392026.04 | 2 | 86.2 | |
| WildGuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.94, Memory Overhead (MB)=13995.25, Evaluation Stage=Post2026.04 | 2 | 56.9 | |
| GuardReasoner (Post)Latency (Sec.)=13.14, Memory Overhead (MB)=15317.422026.04 | 2.2 | 86.2 | |
| SelfDefendBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=2.02, Memory Overhead (MB)=13137.25, Mode=Intent2026.04 | 2.4 | 29.1 | |
| Token HighlighterLatency (Sec.)=15.20, Memory Overhead (MB)=65536.662026.04 | 3.6 | 10 | |
| SelfDefendDefense Protocol=Direct, Latency (Sec.)=0.84, Memory Overhead (MB)=13183.912026.04 | 5.4 | 26 | |
| SelfDefendDefense Protocol=Intent, Latency (Sec.)=2.14, Memory Overhead (MB)=13194.112026.04 | 5.7 | 29.1 | |
| Llama Guard (Pre)Latency (Sec.)=0.62, Memory Overhead (MB)=13697.272026.04 | 6 | 56.1 | |
| Llama Guard (Post)Latency (Sec.)=0.70, Memory Overhead (MB)=13783.602026.04 | 6.1 | 96.6 | |
| Llama Guardvariant=Pre, Target LLM=LLama-3-8B Instruct2026.04 | 6.4 | 62.4 | |
| LLama-3-8B-Instruct (No Defense)Latency (Sec.)=0.862026.04 | 7.8 | — | |
| Perplexity FilterLatency (Sec.)=0.27, Memory Overhead (MB)=13279.462026.04 | 7.8 | 100 | |
| Llama GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.36, Memory Overhead (MB)=13592.75, Evaluation Stage=Pre2026.04 | 8.1 | 56.1 | |
| GradientCuffBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=80.70, Memory Overhead (MB)=1672.502026.04 | 10.2 | 27.7 | |
| Llama GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.45, Memory Overhead (MB)=13739.13, Evaluation Stage=Post2026.04 | 10.5 | 79.2 | |
| Llama GuardDeployment Stage=Pre, Latency (Sec.)=0.49, Memory Overhead (MB)=13649.822026.04 | 19.4 | 56.1 | |
| Llama GuardDeployment Stage=Post, Latency (Sec.)=0.56, Memory Overhead (MB)=13753.872026.04 | 25 | 68.4 | |
| SelfGraderQ=10, Latency (Sec.)=0.74, Memory Overhead (MB)=2765.652026.04 | 25.1 | 55.2 | |
| Qwen2.5-7B-Instruct (No Defense)Backbone=Qwen2.5-7B-Instruct, Latency (Sec.)=5.292026.04 | 25.7 | — | |
| Perplexity FilterBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.10, Memory Overhead (MB)=13134.882026.04 | 25.7 | 100 | |
| Vicuna-13B-v1.5Defense=No Defense, Latency (Sec.)=3.202026.04 | 47.4 | — | |
| Perplexity FilterLatency (Sec.)=0.17, Memory Overhead (MB)=13214.012026.04 | 47.4 | 100 |