System Prompt Extraction on Instruction Hierarchy (test)
99.7Attack Success Rate (Realistic User)OpenAI o3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI o32025.12 | 99.7 | 98.2 | 98.2 | |
| gpt-5-thinking2025.12 | 99 | 99.1 | 99.1 | |
| gpt-5-main2025.12 | 88.5 | 93 | 78.9 | |
| GPT-4o2025.12 | 88.5 | 82.5 | 56.1 |