Prompt-Injection Defense on Adaptive Prompt Injection (train)
32Attack Success Rate (ASR)ACT
Evaluation Results
| Method | Links | |
|---|---|---|
| ACTTarget Model=GPT-OSS-20B, Attacker suffixes=best-of-82026.05 | 32 | |
| BCTTarget Model=Phi-4-reasoning, Attacker suffixes=best-of-82026.05 | 42.4 | |
| ACTTarget Model=Phi-4-reasoning, Attacker suffixes=best-of-82026.05 | 50.2 | |
| BCTTarget Model=GPT-OSS-20B, Attacker suffixes=best-of-82026.05 | 52 | |
| ACTTarget Model=Qwen3-8B, Attacker suffixes=best-of-82026.05 | 65 | |
| ACTTarget Model=Qwen3-1.7B, Attacker suffixes=best-of-82026.05 | 73 | |
| BCTTarget Model=Qwen3-1.7B, Attacker suffixes=best-of-82026.05 | 92 | |
| BaselineTarget Model=Phi-4-reasoning, Attacker suffixes=best-of-82026.05 | 94 | |
| BCTTarget Model=Qwen3-8B, Attacker suffixes=best-of-82026.05 | 95 | |
| BaselineTarget Model=Qwen3-8B, Attacker suffixes=best-of-82026.05 | 98 | |
| ACTTarget Model=Gemma-4-E4B-it, Attacker suffixes=best-of-82026.05 | 99 | |
| BaselineTarget Model=Qwen3-1.7B, Attacker suffixes=best-of-82026.05 | 100 | |
| BaselineTarget Model=GPT-OSS-20B, Attacker suffixes=best-of-82026.05 | 100 | |
| BaselineTarget Model=Gemma-4-E4B-it, Attacker suffixes=best-of-82026.05 | 100 | |
| BCTTarget Model=Gemma-4-E4B-it, Attacker suffixes=best-of-82026.05 | 100 |