Red-teaming Safety Evaluation on Advbench
68HPRMeta-Llama-3.1-8B (Unaligned)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Meta-Llama-3.1-8B (Unaligned)base_model=Meta-Llama-3.1-8B2025.05 | 68 | 3.23 | 44 | |
| Meta-Llama-3.1-8B (HH_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=HH_RLHF2025.05 | 67 | 3.49 | 46 | |
| Meta-Llama-3.1-8B (WILDCHAT-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDCHAT2025.05 | 38 | 3.07 | 29 | |
| Meta-Llama-3.1-8B (SAFE_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=SAFE_RLHF2025.05 | 34 | 2.6 | 23 | |
| Meta-Llama-3.1-8B (AART-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=AART2025.05 | 29 | 2.22 | 15 | |
| Meta-Llama-3.1-8B (ATTAQ-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=ATTAQ2025.05 | 26 | 2.5 | 19 | |
| Meta-Llama-3.1-8B (WILDBREAK-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDBREAK2025.05 | 24 | 2.31 | 14 | |
| Meta-Llama-3.1-8B (TRIDENT-EDGE-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=TRIDENT-EDGE2025.05 | 21 | 1.86 | 9 |