Benign completion reliability on Agent Security Bench Benign
99Completion ReliabilityGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Safety Scaffolding=MOSAIC, Evaluation Mode=Zero-shot2026.03 | 99 | |
| GPT-5Safety Scaffolding=Base, Evaluation Mode=Zero-shot2026.03 | 98 | |
| GPT-4oSafety Scaffolding=MOSAIC, Evaluation Mode=Zero-shot2026.03 | 93 | |
| Phi-4Safety Scaffolding=MOSAIC, Evaluation Mode=Zero-shot2026.03 | 91 | |
| Qwen2.5-7BSafety Scaffolding=Base, Evaluation Mode=Zero-shot2026.03 | 90 | |
| GPT-4oSafety Scaffolding=Base, Evaluation Mode=Zero-shot2026.03 | 89 | |
| Qwen3-4B-ThinkSafety Scaffolding=MOSAIC, Evaluation Mode=Zero-shot2026.03 | 85 | |
| Qwen2.5-7BSafety Scaffolding=MOSAIC, Evaluation Mode=Zero-shot2026.03 | 84 | |
| Phi-4Safety Scaffolding=Base, Evaluation Mode=Zero-shot2026.03 | 78 | |
| Qwen3-4B-ThinkSafety Scaffolding=Base, Evaluation Mode=Zero-shot2026.03 | 44 |