Adversarial Detection on Direct Harmful Prompts
100DSRGradSafe
Evaluation Results
| Method | Links | |
|---|---|---|
| GradSafeTarget Model=Llama-3.1-8B-Instruct, Grad=true2026.05 | 100 | |
| GradSafeTarget Model=Qwen2.5-7B-Instruct, Grad=true2026.05 | 99.4 | |
| Linear ProbeTarget Model=Qwen2.5-7B-Instruct, Params=<1M, Grad=false2026.05 | 99 | |
| SALOTarget Model=Qwen2.5-7B-Instruct, Params=<20M, Grad=false2026.05 | 99 | |
| SALOTarget Model=Mistral-7B-Instruct-v0.3, Params=<20M, Grad=false2026.05 | 99 | |
| Linear ProbeTarget Model=Mistral-7B-Instruct-v0.3, Params=<1M, Grad=false2026.05 | 98.7 | |
| SALOTarget Model=Llama-3.1-8B-Instruct, Params=<20M, Grad=false2026.05 | 98.3 | |
| No Defense (1-ASR)Target Model=Qwen2.5-7B-Instruct2026.05 | 97.9 | |
| No Defense (1-ASR)Target Model=Llama-3.1-8B-Instruct2026.05 | 96.9 | |
| Smooth LLMTarget Model=Qwen2.5-7B-Instruct, Grad=false2026.05 | 94.4 | |
| Linear ProbeTarget Model=Llama-3.1-8B-Instruct, Params=<1M, Grad=false2026.05 | 93.4 | |
| GradSafeTarget Model=Mistral-7B-Instruct-v0.3, Grad=true2026.05 | 88.1 | |
| Smooth LLMTarget Model=Llama-3.1-8B-Instruct, Grad=false2026.05 | 81.7 | |
| No Defense (1-ASR)Target Model=Mistral-7B-Instruct-v0.32026.05 | 65 | |
| Smooth LLMTarget Model=Mistral-7B-Instruct-v0.3, Grad=false2026.05 | 58.1 | |
| PPL FilterTarget Model=Mistral-7B-Instruct-v0.3, Grad=false2026.05 | 1.5 | |
| PPL FilterTarget Model=Qwen2.5-7B-Instruct, Grad=false2026.05 | 0 | |
| PPL FilterTarget Model=Llama-3.1-8B-Instruct, Grad=false2026.05 | 0 |