Privacy-preserving Agent Interaction on Privacy Defense Evaluation After Strategic Attack
38.1PP ScoreCDI
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CDIBackbone=gpt-4.1-mini, Instructor model=Averaged over five models (Qwen3-4B, Qwen3-4B-SafeRL, gpt-oss-20B, gpt-oss-safeguard-20B, gpt-4.1-mini)2026.03 | 38.1 | 89.8 | 71.4 | |
| GuardingBackbone=gpt-4.1-mini, Guard model=Averaged over five models (Qwen3-4B, Qwen3-4B-SafeRL, gpt-oss-20B, gpt-oss-safeguard-20B, gpt-4.1-mini)2026.03 | 19.6 | 89.8 | 66.5 | |
| PromptingBackbone=gpt-4.1-mini2026.03 | 11.8 | 94.1 | 66.7 | |
| N/ABackbone=gpt-4.1-mini2026.03 | 8.8 | 94.9 | 66.3 |