Jailbreak Attack Evaluation on AdvBench-X Swahili multilingual (test)
1.34ASR (OpenAI Moderation)Trajectory-Level Safety Alignment
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Trajectory-Level Safety AlignmentCondition=Injection, Base Model=Llama-3.1-8B-Instruct2026.06 | 1.34 | 0.19 | |
| Llama-3.1-8B-InstructCondition=No Attack2026.06 | 6.14 | 3.65 | |
| Llama-3.1-8B-InstructCondition=Injection (no def.)2026.06 | 11.13 | 8.83 |