Prompt Injection Defense on AgentDojo Workspace suite v1 (test)
0.375CURepeat Prompt
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Repeat PromptTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.375 | 0.3125 | 0 | |
| No DefenseTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.325 | 0.4042 | 0.42 | |
| Task ShieldTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.3 | 0.3458 | 0 | |
| Tool FilterTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.275 | 0.3083 | 0 | |
| DelimitingTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.25 | 0.3375 | 0.83 | |
| PI DetectorTarget Model=GPT-3.5-turbo, Attack=Important Messages2024.12 | 0.225 | 0.2375 | 0.42 |