Sequential Model Defense on Llama-S Case I: Base -> DPO -> RMU
66.3Safety ScoreDPO -> RMU
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DPO -> RMUDefense=+D1+D22026.05 | 66.3 | 3.7 | |
| BaseDefense=Base2026.05 | 66 | 70.7 | |
| DPODefense=+D12026.05 | 53 | 71.3 | |
| Conflict-Guided Layer FreezingDefense=+D1+D2 (frozen L7)2026.05 | 51 | 3.5 |