Representation-level Safety Evaluation on LLM Latent Safety Evaluation layer-wise v1
152.4LVS (Embedding Layer)P-SACPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| P-SACPOModel Family=Alpaca Family, Alignment Strategy=Harmless + Helpful, Perturbation Budget (ε)=0.0012026.06 | 152.4 | 3.832 | 10.362 | |
| alpaca-7b-reproducedModel Family=Alpaca Family, Alignment Strategy=Baseline, Perturbation Budget (ε)=0.0012026.06 | 121.957 | 2.025 | 0 | |
| Beaver-7B-v3.0Model Family=Alpaca Family, Alignment Strategy=Harmless + Helpful, Perturbation Budget (ε)=0.0012026.06 | 115.538 | 3.131 | 0 | |
| SACPOModel Family=Alpaca Family, Alignment Strategy=Harmless + Helpful, Perturbation Budget (ε)=0.0012026.06 | 62.757 | 2.339 | 7.448 | |
| dolphin-2.9-llama3-8bModel Family=Llama-3 Family, Alignment Strategy=Safety ↓ – Data, Perturbation Budget (ε)=0.0012026.06 | 17.875 | 0.345 | 201.19 | |
| Llama-3-8B-Instruct-RRModel Family=Llama-3 Family, Alignment Strategy=Safety ↑, Perturbation Budget (ε)=0.0012026.06 | 9.182 | 2.16 | 0 | |
| Llama-3-8B-Instruct-abliteratedModel Family=Llama-3 Family, Alignment Strategy=Safety ↓ – Weight, Perturbation Budget (ε)=0.0012026.06 | 5.207 | 1.102 | 55.665 | |
| Meta-Llama-3-8B-InstructModel Family=Llama-3 Family, Alignment Strategy=Baseline, Perturbation Budget (ε)=0.0012026.06 | 4.914 | 3.483 | 0 |