Harmful Request Rejection on strongREJECT
0Acceptance Rate (ASR)AlphaAlign
Evaluation Results
| Method | Links | |||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AlphaAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO+PolicyBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PolicyAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO+PolicyBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PolicyAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ICLBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PolicyAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ICLBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NSPOBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AlphaAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 0.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AlphaAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 0.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 0.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ICLBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NSPOBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 0.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NSPOBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 0.96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GRPO+PolicyBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0.96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Base2026.06 | 1.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Base2026.06 | 2.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 2.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Base2026.06 | 4.15 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Alignment Gating (Gating Inversion)Backbone=Qwen3-8B, Protocol=Gating Inversion, Evaluation=External API model2026.06 | — | — | 1 | 0.3 | 1.6 | 1.3 | 1.3 | 1.1 | 3.8 | 1.6 | 6.1 | 1.6 | 5.8 | 3.8 | 3.8 | |
| Alignment Gating (Gating Inversion)Backbone=Qwen3-14B, Protocol=Gating Inversion, Evaluation=External API model2026.06 | — | — | 0.3 | 0.3 | 0.3 | 0.3 | 0.3 | 0.3 | 2.2 | 1 | 5.4 | 1.3 | 3.8 | 2.7 | 1 | |
| BaseBackbone=Qwen3-4B2026.06 | — | 7.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ICLBackbone=Qwen3-4B2026.06 | — | 0 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PolicyAlignBackbone=Qwen3-4B2026.06 | — | 0.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBackbone=Qwen3-4B2026.06 | — | 1.6 | — | — | — | — | — | — | — | — | — | — | — | — | — |