Harmful Request Defense on AdvBench
0ASRSafeKey
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SafeKeyModel Scale=Qwen3-4B2026.01 | 0 | — | |
| ReasoningGuardModel Scale=Qwen3-4B2026.01 | 0 | — | |
| Self-ReminderModel Scale=Qwen3-4B2026.01 | 0 | — | |
| Self-GuardModel Scale=Qwen3-4B2026.01 | 0 | — | |
| STAR-1Model Scale=Qwen3-8B2026.01 | 0 | — | |
| SafeKeyModel Scale=Qwen3-8B2026.01 | 0 | — | |
| ReasoningGuardModel Scale=Qwen3-8B2026.01 | 0 | — | |
| Self-ReminderModel Scale=Qwen3-8B2026.01 | 0 | — | |
| Self-GuardModel Scale=Qwen3-8B2026.01 | 0 | — | |
| STAR-1Model Scale=Qwen3-14B2026.01 | 0 | — | |
| SafeKeyModel Scale=Qwen3-14B2026.01 | 0 | — | |
| Alpha-steerModel Scale=Qwen3-14B2026.01 | 0 | — | |
| ReasoningGuardModel Scale=Qwen3-14B2026.01 | 0 | — | |
| Self-ReminderModel Scale=Qwen3-14B2026.01 | 0 | — | |
| Self-GuardModel Scale=Qwen3-14B2026.01 | 0 | — | |
| W-DOORBackbone=Qwen2.5-7B-Instruct2025.12 | 0 | — | |
| GRPO+PolicyBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0 | — | |
| PolicyAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0 | — | |
| SFTBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 0 | — | |
| PolicyAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0 | — | |
| ICLBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0 | — | |
| PolicyAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Policy-Based Safety Alignment2026.06 | 0 | — | |
| DPO-SBackbone=Llama3-8B-Instruct2025.12 | 0.06 | — | |
| NSPOBackbone=Llama3-8B-Instruct2025.12 | 0.06 | — | |
| ICLBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0.19 | — | |
| AlphaAlignBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 0.19 | — | |
| NSPOBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 0.19 | — | |
| BaseBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Base2026.06 | 0.19 | — | |
| SFTBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 0.19 | — | |
| AlphaAlignBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 0.19 | — | |
| STAR-1Model Scale=Qwen3-4B2026.01 | 0.2 | — | |
| NSPOBackbone=Qwen2.5-7B-Instruct2025.12 | 0.29 | — | |
| PeCANBackbone=Llama3-8B-Instruct2025.12 | 0.38 | — | |
| ICLBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=In-Context Learning (System Prompt)2026.06 | 0.38 | — | |
| GRPO+PolicyBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0.38 | — | |
| NSPOBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 0.38 | — | |
| GRPO+PolicyBackbone=Qwen2.5-14B-Instruct, Alignment Strategy=Group Relative Policy Optimization with policy-conditioned reward2026.06 | 0.38 | — | |
| BaseBackbone=Qwen2.5-7B-Instruct, Alignment Strategy=Base2026.06 | 0.58 | — | |
| InstructModel Scale=Qwen3-4B2026.01 | 0.6 | — | |
| BFPOBackbone=Llama3-8B-Instruct2025.12 | 0.64 | — | |
| W-DOORBackbone=Llama3-8B-Instruct2025.12 | 0.75 | — | |
| BFPOBackbone=Qwen2.5-7B-Instruct2025.12 | 0.96 | — | |
| Alpha-steerModel Scale=Qwen3-4B2026.01 | 1 | — | |
| MoCANBackbone=Llama3-8B-Instruct2025.12 | 1.09 | — | |
| MoCANBackbone=Qwen2.5-7B-Instruct2025.12 | 1.22 | — | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct2025.12 | 1.28 | — | |
| Llama3-8B-InstructBackbone=Llama3-8B-Instruct2025.12 | 1.36 | — | |
| DPO-HBackbone=Qwen2.5-7B-Instruct2025.12 | 1.47 | — | |
| InstructModel Scale=Qwen3-14B2026.01 | 1.5 | — | |
| DPO-SBackbone=Qwen2.5-7B-Instruct2025.12 | 1.67 | — | |
| InstructModel Scale=Qwen3-8B2026.01 | 1.7 | — | |
| AlphaAlignBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=RL-based alignment2026.06 | 1.92 | — | |
| PeCANBackbone=Qwen2.5-7B-Instruct2025.12 | 1.99 | — | |
| Alpha-steerModel Scale=Qwen3-8B2026.01 | 2 | — | |
| BaseBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Base2026.06 | 2.12 | — | |
| SFTBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Supervised Fine-Tuning2026.06 | 2.12 | — | |
| NSPOBackbone=LLaMA-3.2-3B-Instruct, Alignment Strategy=Null-space constrained policy optimization2026.06 | 2.12 | — | |
| DPO-MixBackbone=Qwen2.5-7B-Instruct2025.12 | 2.24 | — | |
| DPO-MixBackbone=Llama3-8B-Instruct2025.12 | 3.84 | — | |
| SafeRLHFBackbone=Qwen2.5-7B-Instruct2025.12 | 6.64 | — | |
| SafeRLHFBackbone=Llama3-8B-Instruct2025.12 | 14.39 | — | |
| SafeChainModel Scale=Qwen3-4B2026.01 | 25.4 | — | |
| SafeChainModel Scale=Qwen3-14B2026.01 | 26 | — | |
| SafeChainModel Scale=Qwen3-8B2026.01 | 27.5 | — | |
| DPO-HBackbone=Llama3-8B-Instruct2025.12 | 37.41 | — |