Jailbreak Robustness on Fortress
7.2ASRPolicyAlign
Evaluation Results
| Method | Links | |
|---|---|---|
| PolicyAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 7.2 | |
| PolicyAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 7.4 | |
| SFTBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 7.6 | |
| GRPO+PolicyBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 8.6 | |
| GRPO+PolicyBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 9.2 | |
| ICLBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 9.4 | |
| AlphaAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 9.4 | |
| NSPOBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 9.8 | |
| AlphaAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 10 | |
| SFTBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 10.2 | |
| NSPOBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 10.4 | |
| PolicyAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 15.4 | |
| GRPO+PolicyBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 16.4 | |
| ICLBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 16.6 | |
| SFTBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 17.8 | |
| AlphaAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 18.2 | |
| NSPOBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 18.4 | |
| BaseBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Base2026.06 | 32.4 | |
| ICLBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 43.2 | |
| BaseBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Base2026.06 | 46.4 | |
| BaseBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Base2026.06 | 61 |