Red-teaming Safety Evaluation on Harmbench
0.3ASRSafeKey
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SafeKeyModel Scale=Qwen3-8B2026.01 | 0.3 | — | — | — | |
| STAR-1Model Scale=Qwen3-8B2026.01 | 0.5 | — | — | — | |
| SafeKeyModel Scale=Qwen3-4B2026.01 | 0.8 | — | — | — | |
| Meta-Llama-3.1-8B (ATTAQ-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=ATTAQ2025.05 | 1 | 2 | 1.64 | — | |
| SafeKeyModel Scale=Qwen3-14B2026.01 | 1 | — | — | — | |
| STAR-1Model Scale=Qwen3-14B2026.01 | 1.3 | — | — | — | |
| STAR-1Model Scale=Qwen3-4B2026.01 | 1.5 | — | — | — | |
| ReasoningGuardModel Scale=Qwen3-14B2026.01 | 1.5 | — | — | — | |
| Meta-Llama-3.1-8B (AART-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=AART2025.05 | 2 | 12 | 1.65 | — | |
| Meta-Llama-3.1-8B (TRIDENT-EDGE-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=TRIDENT-EDGE2025.05 | 2 | 6 | 1.64 | — | |
| Self-GuardModel Scale=Qwen3-14B2026.01 | 3 | — | — | — | |
| ReasoningGuardModel Scale=Qwen3-8B2026.01 | 3.5 | — | — | — | |
| Meta-Llama-3.1-8B (SAFE_RLHF-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=SAFE_RLHF2025.05 | 4 | 15 | 1.87 | — | |
| Self-GuardModel Scale=Qwen3-4B2026.01 | 4.8 | — | — | — | |
| Self-GuardModel Scale=Qwen3-8B2026.01 | 5 | — | — | — | |
| Self-ReminderModel Scale=Qwen3-14B2026.01 | 6.8 | — | — | — | |
| Meta-Llama-3.1-8B (HH_RLHF-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=HH_RLHF2025.05 | 7 | 46 | 1.91 | — | |
| Meta-Llama-3.1-8B (WILDCHAT-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=WILDCHAT2025.05 | 7 | 27 | 2.04 | — | |
| Meta-Llama-3.1-8B (WILDBREAK-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=WILDBREAK2025.05 | 9 | 36 | 2.37 | — | |
| ReasoningGuardModel Scale=Qwen3-4B2026.01 | 9 | — | — | — | |
| Self-ReminderModel Scale=Qwen3-8B2026.01 | 10.5 | — | — | — | |
| Self-ReminderModel Scale=Qwen3-4B2026.01 | 12 | — | — | — | |
| Meta-Llama-3.1-8B (Unaligned)base_model=Meta-Llama-3.1-8B, alignment_status=unaligned2025.05 | 19 | 41 | 2.29 | — | |
| Alpha-steerModel Scale=Qwen3-14B2026.01 | 30.8 | — | — | — | |
| InstructModel Scale=Qwen3-8B2026.01 | 35.5 | — | — | — | |
| Alpha-steerModel Scale=Qwen3-8B2026.01 | 36.3 | — | — | — | |
| InstructModel Scale=Qwen3-14B2026.01 | 38 | — | — | — | |
| Alpha-steerModel Scale=Qwen3-4B2026.01 | 39.5 | — | — | — | |
| InstructModel Scale=Qwen3-4B2026.01 | 40.8 | — | — | — | |
| SafeChainModel Scale=Qwen3-4B2026.01 | 49.3 | — | — | — | |
| SafeChainModel Scale=Qwen3-14B2026.01 | 51.5 | — | — | — | |
| SafeChainModel Scale=Qwen3-8B2026.01 | 53.3 | — | — | — |