LLM Safety Evaluation on Unsafe and Jailbreak prompts reference and calibration models
0.283Unsafe Scoremeta-llama/Llama-3.1-8B-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| meta-llama/Llama-3.1-8B-InstructModel Family=Llama-3.1, Base Model=8B-Instruct2026.06 | 0.283 | 0.193 | 10.6 | |
| vicgalle/Configurable-Llama-3.1-8B-InstructModel Family=Llama-3.1, Type=Configurable Instruct2026.06 | 0.165 | 0.046 | 12.7 | |
| ValiantLabs/Llama3.1-8B-Fireplace2Model Family=Llama-3.1, Type=Fireplace22026.06 | 0.088 | 0.01 | 35.8 | |
| nvidia/Llama-3.1-Nemotron-Nano-8B-v1Model Family=Llama-3.1, Model name=Nemotron-Nano-8B-v12026.06 | 0.074 | 0.047 | 28.1 | |
| Orenguteng/Llama-3.1-8B-Lexi-Uncensored-V2Model Family=Llama-3.1, Safety Alignment=Uncensored, Variant=Lexi-V22026.06 | 0.064 | -0.057 | 93.9 | |
| Rupesh2/Llama-3.1-8B-UncensoredModel Family=Llama-3.1, Safety Alignment=Uncensored2026.06 | -0.074 | -0.131 | 63.3 | |
| aifeifei798/DarkIdol-Llama-3.1-8B-Instruct-1.2-UncensoredModel Family=Llama-3.1, Safety Alignment=Uncensored, Variant=DarkIdol-1.22026.06 | -0.115 | -0.165 | 93.6 | |
| mlabonne/Meta-Llama-3.1-8B-Instruct-abliteratedModel Family=Llama-3.1, Safety Alignment=abliterated2026.06 | -0.155 | -0.181 | 93.3 |