Jailbreak Attack Evaluation on AdvBench-X Korean multilingual (test)
5.19ASR (OpenAI Moderation)Trajectory-Level Safety Alignment
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Trajectory-Level Safety AlignmentCondition=Injection, Base Model=Llama-3.1-8B-Instruct2026.06 | 5.19 | 0 | |
| Llama-3.1-8B-InstructCondition=No Attack2026.06 | 19.04 | 1.15 | |
| Llama-3.1-8B-InstructCondition=Injection (no def.)2026.06 | 36.35 | 19.62 |