LLM Agent Safety on Frontier Models Evaluation Set Harmful Queries
94.3Harmful Refusal RateQwen3-32B + SAFEHARBOR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-32B + SAFEHARBORDefense=SAFEHARBOR2026.05 | 94.3 | 4.2 | |
| GPT-5 + SAFEHARBORDefense=SAFEHARBOR2026.05 | 84.9 | 8.7 | |
| Claude-3.5-Sonnet + SAFEHARBORDefense=SAFEHARBOR2026.05 | 84.1 | 7.8 | |
| Claude-3.5-SonnetDefense=Base2026.05 | 80.1 | 8.8 | |
| GPT-5Defense=Base2026.05 | 69.3 | 16.8 | |
| Qwen3-32BDefense=Base2026.05 | 40.8 | 42.7 |