Safety Alignment on AdvBench (HarmRate)
0Harm RateBoN64
Evaluation Results
| Method | Links | |
|---|---|---|
| BoN64Base Model=LLaMA2-13B-Chat2025.05 | 0 | |
| SEABase Model=LLaMA2-13B-Chat2025.05 | 0 | |
| Sqrt-CompetenceBackbone=Yi-1.5-9B2026.05 | 0 | |
| Staged-CompetenceBackbone=Yi-1.5-9B2026.05 | 0.2 | |
| Staged-CompetenceBackbone=Qwen3-8B2026.05 | 0.4 | |
| SequentialBackbone=Yi-1.5-9B2026.05 | 0.4 | |
| Curri-DPOBackbone=Yi-1.5-9B2026.05 | 1 | |
| Standard DPO (Baseline)Backbone=Yi-1.5-9B2026.05 | 1.5 | |
| SequentialBackbone=LLaMA-3-8B2026.05 | 4.4 | |
| Staged-CompetenceBackbone=LLaMA-3-8B2026.05 | 5.4 | |
| Sqrt-CompetenceBackbone=LLaMA-3-8B2026.05 | 8.5 | |
| Curri-DPOBackbone=LLaMA-3-8B2026.05 | 9.2 | |
| Standard DPO (Baseline)Backbone=LLaMA-3-8B2026.05 | 18.7 | |
| Curri-DPOBackbone=Qwen3-8B2026.05 | 21.3 | |
| SequentialBackbone=Qwen3-8B2026.05 | 27.5 | |
| DPO + WeMask (TF)Training/Inference Setting=TF (training-free)2026.05 | 32.81 | |
| DPO + WeMask (TA)Training/Inference Setting=TA (training-aware)2026.05 | 33.57 | |
| DPO2026.05 | 33.8 | |
| Qwen3-4B2026.05 | 35.78 | |
| SFTBase Model=LLaMA2-13B-Chat2025.05 | 38 | |
| Standard DPO (Baseline)Backbone=Qwen3-8B2026.05 | 38.5 | |
| Sqrt-CompetenceBackbone=Qwen3-8B2026.05 | 39 | |
| UnalignedBackbone=Yi-1.5-9B2026.05 | 73.3 | |
| UnalignedBackbone=LLaMA-3-8B2026.05 | 93.8 | |
| UnalignedBackbone=Qwen3-8B2026.05 | 94.2 |