Defense Robustness on Soft Prompt Attack
100DSR Keyword Success RateES2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ES2LLM=Llama-2 (7B-Chat-hf), Human Evaluated=true2026.03 | 100 | 98 | 97 | |
| ES2LLM=Llama-3 (8B-Instruct)2026.03 | 99 | 98 | 98 | |
| ES2LLM=Qwen-2.5 (7B-Instruct)2026.03 | 99 | 98 | 98 | |
| DPLLLM=Llama-3 (8B-Instruct)2026.03 | 96 | 95 | 91 | |
| STLLLM=Llama-2 (7B-Chat-hf), Human Evaluated=true2026.03 | 94 | 91 | 86 | |
| STLLLM=Llama-3 (8B-Instruct)2026.03 | 94 | 89 | 88 | |
| STLLLM=Qwen-2.5 (7B-Instruct)2026.03 | 94 | 90 | 88 | |
| DPLLLM=Llama-2 (7B-Chat-hf), Human Evaluated=true2026.03 | 93 | 93 | 90 | |
| DPLLLM=Qwen-2.5 (7B-Instruct)2026.03 | 92 | 91 | 87 | |
| Base ModelLLM=Qwen-2.5 (7B-Instruct)2026.03 | 91 | 87 | 82 | |
| Base ModelLLM=Llama-3 (8B-Instruct)2026.03 | 88 | 86 | 81 | |
| Base ModelLLM=Llama-2 (7B-Chat-hf), Human Evaluated=true2026.03 | 84 | 77 | 71 | |
| ES2LLM=Mistral (7B-Instruct)2026.03 | 81 | 77 | 76 | |
| DPLLLM=Mistral (7B-Instruct)2026.03 | 62 | 57 | 52 | |
| STLLLM=Mistral (7B-Instruct)2026.03 | 59 | 54 | 48 | |
| Base ModelLLM=Mistral (7B-Instruct)2026.03 | 58 | 53 | 47 |