Red-teaming Safety Evaluation on XSTEST
61HPRMeta-Llama-3.1-8B (Unaligned)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Meta-Llama-3.1-8B (Unaligned)base_model=Meta-Llama-3.1-8B, alignment_status=unaligned2025.05 | 61 | 3.04 | 41 | |
| Meta-Llama-3.1-8B (HH_RLHF-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=HH_RLHF2025.05 | 50 | 3.27 | 35 | |
| Meta-Llama-3.1-8B (TRIDENT-EDGE-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=TRIDENT-EDGE2025.05 | 40 | 2.02 | 3 | |
| Meta-Llama-3.1-8B (SAFE_RLHF-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=SAFE_RLHF2025.05 | 39 | 2.34 | 6 | |
| Meta-Llama-3.1-8B (WILDBREAK-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=WILDBREAK2025.05 | 38 | 2.19 | 8 | |
| Meta-Llama-3.1-8B (WILDCHAT-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=WILDCHAT2025.05 | 34 | 2.23 | 11 | |
| Meta-Llama-3.1-8B (AART-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=AART2025.05 | 27 | 2.08 | 11 | |
| Meta-Llama-3.1-8B (ATTAQ-aligned)base_model=Meta-Llama-3.1-8B, fine_tuning=LoRA, alignment_dataset=ATTAQ2025.05 | 23 | 2.24 | 16 |