Adversarial Detection on Prefilling
99.4DSRSALO
Evaluation Results
| Method | Links | |
|---|---|---|
| SALOTarget Model=Qwen2.5-7B-Instruct, Params=<20M, Grad=false2026.05 | 99.4 | |
| SALOTarget Model=Mistral-7B-Instruct-v0.3, Params=<20M, Grad=false2026.05 | 99.4 | |
| SALOTarget Model=Llama-3.1-8B-Instruct, Params=<20M, Grad=false2026.05 | 98.8 | |
| Linear ProbeTarget Model=Qwen2.5-7B-Instruct, Params=<1M, Grad=false2026.05 | 96.5 | |
| Linear ProbeTarget Model=Llama-3.1-8B-Instruct, Params=<1M, Grad=false2026.05 | 87.3 | |
| Linear ProbeTarget Model=Mistral-7B-Instruct-v0.3, Params=<1M, Grad=false2026.05 | 68.1 | |
| Smooth LLMTarget Model=Llama-3.1-8B-Instruct, Grad=false2026.05 | 66.5 | |
| Smooth LLMTarget Model=Qwen2.5-7B-Instruct, Grad=false2026.05 | 57.9 | |
| PPL FilterTarget Model=Llama-3.1-8B-Instruct, Grad=false2026.05 | 43.7 | |
| Smooth LLMTarget Model=Mistral-7B-Instruct-v0.3, Grad=false2026.05 | 42.9 | |
| No Defense (1-ASR)Target Model=Llama-3.1-8B-Instruct2026.05 | 39.8 | |
| PPL FilterTarget Model=Qwen2.5-7B-Instruct, Grad=false2026.05 | 39.2 | |
| No Defense (1-ASR)Target Model=Qwen2.5-7B-Instruct2026.05 | 24.8 | |
| No Defense (1-ASR)Target Model=Mistral-7B-Instruct-v0.32026.05 | 15 | |
| GradSafeTarget Model=Llama-3.1-8B-Instruct, Grad=true2026.05 | 12 | |
| GradSafeTarget Model=Mistral-7B-Instruct-v0.3, Grad=true2026.05 | 1.7 | |
| PPL FilterTarget Model=Mistral-7B-Instruct-v0.3, Grad=false2026.05 | 0 | |
| GradSafeTarget Model=Qwen2.5-7B-Instruct, Grad=true2026.05 | 0 |