Safety Alignment Evaluation on RTA
53UtilityNo defense
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| No defenseFine-tuning=on combined dataset without defense2026.05 | 53 | 16 | 1.31 | |
| SEALSetting=fine-tuning with explicit harmful data2026.05 | 53 | 15 | 1.24 | |
| GradShieldSetting=fine-tuning with explicit harmful data2026.05 | 53 | 6 | 1.2 | |
| LlamaguardSetting=fine-tuning with explicit harmful data2026.05 | 52 | 11 | 1.12 | |
| SafeInstrSetting=fine-tuning with explicit harmful data2026.05 | 52 | 0 | 1 | |
| BackdoorSetting=fine-tuning with explicit harmful data2026.05 | 52 | 2 | 1.12 | |
| Safe LoraSetting=fine-tuning with explicit harmful data2026.05 | 52 | 18 | 1.37 | |
| OpenAI ModerationSetting=fine-tuning with explicit harmful data2026.05 | 51 | 21 | 1.33 | |
| BaseFine-tuning=none (original model)2026.05 | 34 | 4 | 1.16 |