Sequential Model Defense on Qwen-S Case III: Base -> Unbias -> RMU
29.88FairnessUnbias -> RMU
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Unbias -> RMUDefense=+D1+D22026.05 | 29.88 | 6.7 | |
| BaseDefense=Base2026.05 | 26.98 | 19 | |
| Conflict-Guided Layer FreezingDefense=+D1+D2 (frozen L6)2026.05 | 5.38 | 3 | |
| UnbiasDefense=+D12026.05 | 1.12 | 13.1 |