Red-teaming Safety Evaluation on Edgebench
4.53HS ScoreMeta-Llama-3.1-8B (Unaligned)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Meta-Llama-3.1-8B (Unaligned)base_model=Meta-Llama-3.1-8B2025.05 | 4.53 | 75 | 85 | |
| Meta-Llama-3.1-8B (HH_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=HH_RLHF2025.05 | 4.24 | 57 | 69 | |
| UnalignedBackbone Model=META-LLAMA-3.1-8B2025.05 | 3.61 | — | 41 | |
| Meta-Llama-3.1-8B (SAFE_RLHF-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=SAFE_RLHF2025.05 | 3.59 | 36 | 47 | |
| Meta-Llama-3.1-8B (AART-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=AART2025.05 | 3.32 | 30 | 34 | |
| HH_RLHFBackbone Model=META-LLAMA-3.1-8B2025.05 | 3.23 | — | 29 | |
| Meta-Llama-3.1-8B (ATTAQ-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=ATTAQ2025.05 | 3.15 | 33 | 29 | |
| AARTBackbone Model=META-LLAMA-3.1-8B2025.05 | 3.14 | — | 27 | |
| SAFE_RLHFBackbone Model=META-LLAMA-3.1-8B2025.05 | 3.08 | — | 23 | |
| WILDCHATBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.91 | — | 23 | |
| Meta-Llama-3.1-8B (WILDCHAT-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDCHAT2025.05 | 2.85 | 29 | 26 | |
| ATTAQBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.81 | — | 23 | |
| Meta-Llama-3.1-8B (TRIDENT-EDGE-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=TRIDENT-EDGE2025.05 | 2.36 | 23 | 18 | |
| WILDBREAKBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.35 | — | 14 | |
| Meta-Llama-3.1-8B (WILDBREAK-aligned)base_model=Meta-Llama-3.1-8B, alignment_dataset=WILDBREAK2025.05 | 2.32 | 29 | 21 | |
| TRIDENT-EDGEBackbone Model=META-LLAMA-3.1-8B2025.05 | 2.19 | — | 12 |