Adversarial Safety Evaluation on AdvBench
2.69ASR (Overall)No Attack
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| No AttackModel Scale=70B, Attack Scenario=No Attack, Base Model=Llama-3.1-70B-Instruct2026.06 | 2.69 | 0.96 | |
| Trajectory-Level Safety AlignmentModel Scale=70B, Attack Scenario=Aligned (Ours), Base Model=Llama-3.1-70B-Instruct2026.06 | 3.46 | 0 | |
| Injection (no def.)Model Scale=70B, Attack Scenario=Injection (no def.), Base Model=Llama-3.1-70B-Instruct2026.06 | 80.58 | 82.12 |