Red-teaming on HarmBench (test)
85.1ASR@1DIALTREE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DIALTREETarget LLMs=Average across GPT-4o, GPT-4.1-mini, Llama-3.1-8B, and Gemma-2-9B2025.10 | 85.1 | 98.6 | 99.5 | |
| X-TeamingTarget LLMs=Average across GPT-4o, GPT-4.1-mini, Llama-3.1-8B, and Gemma-2-9B2025.10 | 44.9 | 69.6 | 78.9 | |
| ActorAttackTarget LLMs=Average across GPT-4o, GPT-4.1-mini, Llama-3.1-8B, and Gemma-2-9B2025.10 | 22.6 | 38.5 | 45.1 |