Jailbreak Defense on AutoDAN (ASR, PGR)
0ASRWildGuard
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| WildGuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=1.00, Memory Overhead (MB)=13939.25, Evaluation Stage=Pre2026.04 | 0 | 2 | |
| GuardReasonerBackbone=Qwen2.5-7B-Instruct, Evaluation Stage=Pre2026.04 | 0 | 1 | |
| SelfGraderBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=1.33, Memory Overhead (MB)=374.252026.04 | 0 | 0 | |
| GuardReasonerBackbone=Qwen2.5-7B-Instruct, Evaluation Stage=Post2026.04 | 1 | 79 | |
| WildGuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.94, Memory Overhead (MB)=13995.25, Evaluation Stage=Post2026.04 | 2 | 85 | |
| SelfDefendBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=2.02, Memory Overhead (MB)=13137.25, Mode=Intent2026.04 | 4 | 9 | |
| SelfDefendBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.64, Memory Overhead (MB)=13130.75, Mode=Direct2026.04 | 6 | 11 | |
| Prompt GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=8.48, Memory Overhead (MB)=1154.582026.04 | 7 | 42 | |
| GradientCuffBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=80.70, Memory Overhead (MB)=1672.502026.04 | 8 | 24 | |
| Llama GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.36, Memory Overhead (MB)=13592.75, Evaluation Stage=Pre2026.04 | 9 | 50 | |
| Qwen2.5-7B-Instruct (No Defense)Backbone=Qwen2.5-7B-Instruct, Latency (Sec.)=5.292026.04 | 10 | — | |
| Perplexity FilterBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.10, Memory Overhead (MB)=13134.882026.04 | 10 | 100 | |
| Llama GuardBackbone=Qwen2.5-7B-Instruct, Latency (Sec.)=0.45, Memory Overhead (MB)=13739.13, Evaluation Stage=Post2026.04 | 10 | 100 |