Red-teaming Safety Evaluation on Basebench
1.73HSMeta-Llama-3.1-8B (AART-aligned)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Meta-Llama-3.1-8B (AART-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=AART2025.05 | 1.73 | 0.06 | 0.02 | |
| Meta-Llama-3.1-8B (TRIDENT-EDGE-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=TRIDENT-EDGE2025.05 | 1.74 | 0.05 | 0.02 | |
| ATTAQBackbone Model=META-LLAMA-3.1-8B2025.05 | 1.76 | — | 0.04 | |
| WILDBREAKBackbone Model=META-LLAMA-3.1-8B2025.05 | 1.85 | — | 0.08 | |
| Meta-Llama-3.1-8B (ATTAQ-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=ATTAQ2025.05 | 1.86 | 0.03 | 0.03 | |
| AARTBackbone Model=META-LLAMA-3.1-8B2025.05 | 1.87 | — | 0.03 | |
| TRIDENT-EDGEBackbone Model=META-LLAMA-3.1-8B2025.05 | 1.91 | — | 0.06 | |
| WILDCHATBackbone Model=META-LLAMA-3.1-8B2025.05 | 1.97 | — | 0.1 | |
| Meta-Llama-3.1-8B (WILDBREAK-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDBREAK2025.05 | 1.98 | 0.17 | 0.08 | |
| SAFE_RLHFBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.11 | — | 0.1 | |
| Meta-Llama-3.1-8B (SAFE_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=SAFE_RLHF2025.05 | 2.19 | 0.24 | 0.09 | |
| HH_RLHFBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.28 | — | 0.12 | |
| Meta-Llama-3.1-8B (WILDCHAT-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDCHAT2025.05 | 2.31 | 0.27 | 0.12 | |
| Meta-Llama-3.1-8B (HH_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=HH_RLHF2025.05 | 2.62 | 0.41 | 0.14 | |
| UnalignedBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.76 | — | 0.19 | |
| Meta-Llama-3.1-8B (Unaligned)base_model=Meta-Llama-3.1-8B2025.05 | 2.84 | 0.48 | 0.18 |