Jailbreak Attack Evaluation on JBB sampled harmful behaviors
100PAIR Success RateM
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MModel Backbone=Gemma-9B, Variant=Unaligned baseline instruction tuned model2025.11 | 100 | 100 | 100 | 10 | |
| MsafepromptModel Backbone=Gemma-9B, Variant=Safe prompt baseline2025.11 | 100 | 100 | 100 | 10 | |
| MModel Backbone=Mistral-7B, Variant=Unaligned baseline instruction tuned model2025.11 | 100 | 100 | 100 | 10 | |
| MsafepromptModel Backbone=Mistral-7B, Variant=Safe prompt baseline2025.11 | 100 | 100 | 100 | 10 | |
| MModel Backbone=Llama-3-8B, Variant=Unaligned baseline instruction tuned model2025.11 | 100 | 100 | 100 | 10 | |
| MsafepromptModel Backbone=Llama-3-8B, Variant=Safe prompt baseline2025.11 | 100 | 100 | 100 | 10 | |
| M+Model Backbone=Gemma-9B, Variant=Policy patch / PEFT safety adapter2025.11 | 0 | 0 | 0 | 1 | |
| M'Model Backbone=Gemma-9B, Variant=Improved model variant2025.11 | 0 | 0 | 0 | 1 | |
| M+Model Backbone=Mistral-7B, Variant=Policy patch / PEFT safety adapter2025.11 | 0 | 0 | 0 | 1 | |
| M'Model Backbone=Mistral-7B, Variant=Improved model variant2025.11 | 0 | 0 | 0 | 1 | |
| M+Model Backbone=Llama-3-8B, Variant=Policy patch / PEFT safety adapter2025.11 | 0 | 0 | 0 | 1 | |
| M'Model Backbone=Llama-3-8B, Variant=Improved model variant2025.11 | 0 | 0 | 0 | 1 |