Malicious Training Sample Detection on Attack Training Samples (test)
100DetectabilityAOA
Evaluation Results
| Method | Links | |
|---|---|---|
| AOAAuditor=GPT-5-mini2026.05 | 100 | |
| AOAAuditor=GPT-5.52026.05 | 100 | |
| NOICEAuditor=GPT-5.52026.05 | 100 | |
| TenBenignAuditor=GPT-5.52026.05 | 100 | |
| AOAAuditor=DeepSeek V4 Pro2026.05 | 100 | |
| NOICEAuditor=DeepSeek V4 Pro2026.05 | 100 | |
| AOAAuditor=Gemini 3.1 Pro Preview2026.05 | 100 | |
| NOICEAuditor=Gemini 3.1 Pro Preview2026.05 | 100 | |
| TenBenignAuditor=Gemini 3.1 Pro Preview2026.05 | 100 | |
| AOAAuditor=Claude Opus 4.72026.05 | 100 | |
| NOICEAuditor=Claude Opus 4.72026.05 | 100 | |
| TenBenignAuditor=Claude Opus 4.72026.05 | 100 | |
| NOICEAuditor=GPT-5-mini2026.05 | 98 | |
| TenBenignAuditor=GPT-5-mini2026.05 | 64 | |
| TenBenignAuditor=DeepSeek V4 Pro2026.05 | 62 | |
| Truly Benign DPO AttackAuditor=Claude Opus 4.72026.05 | 8 | |
| Truly Benign DPO AttackAuditor=OpenAI Moderation API2026.05 | 0 | |
| IndirectAuditor=OpenAI Moderation API2026.05 | 0 | |
| AOAAuditor=OpenAI Moderation API2026.05 | 0 | |
| NOICEAuditor=OpenAI Moderation API2026.05 | 0 | |
| TenBenignAuditor=OpenAI Moderation API2026.05 | 0 | |
| Truly Benign DPO AttackAuditor=GPT-5-mini2026.05 | 0 | |
| IndirectAuditor=GPT-5-mini2026.05 | 0 | |
| Truly Benign DPO AttackAuditor=GPT-5.52026.05 | 0 | |
| IndirectAuditor=GPT-5.52026.05 | 0 | |
| Truly Benign DPO AttackAuditor=DeepSeek V4 Pro2026.05 | 0 | |
| IndirectAuditor=DeepSeek V4 Pro2026.05 | 0 | |
| Truly Benign DPO AttackAuditor=Gemini 3.1 Pro Preview2026.05 | 0 | |
| IndirectAuditor=Gemini 3.1 Pro Preview2026.05 | 0 | |
| IndirectAuditor=Claude Opus 4.72026.05 | 0 |