Finetuning with implicit harmful data on Identity-shift
53UtilitySafe Lora
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Safe LoraFine-tuning=on combined dataset2026.05 | 53 | 62 | 3.27 | |
| OpenAI ModerationFine-tuning=on combined dataset2026.05 | 52 | 29 | 1.92 | |
| LlamaguardFine-tuning=on combined dataset2026.05 | 52 | 53 | 2.98 | |
| No defenseFine-tuning=on combined dataset2026.05 | 51 | 75 | 3.75 | |
| SafeInstrFine-tuning=on combined dataset2026.05 | 51 | 8 | 1.24 | |
| BackdoorFine-tuning=on combined dataset2026.05 | 51 | 11 | 1.37 | |
| GradShieldFine-tuning=on combined dataset2026.05 | 51 | 1 | 1.01 | |
| BaseFine-tuning=none2026.05 | 34 | 0 | 1 |