Safety Alignment Evaluation on LATharm
54UtilityOpenAI Moderation
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI ModerationSetting=fine-tuning with explicit harmful data2026.05 | 54 | 75 | 3.86 | |
| No defenseFine-tuning=on combined dataset without defense2026.05 | 53 | 98 | 4.96 | |
| BackdoorSetting=fine-tuning with explicit harmful data2026.05 | 53 | 84 | 4.44 | |
| GradShieldSetting=fine-tuning with explicit harmful data2026.05 | 53 | 1 | 1.04 | |
| LlamaguardSetting=fine-tuning with explicit harmful data2026.05 | 52 | 7 | 1.21 | |
| SafeInstrSetting=fine-tuning with explicit harmful data2026.05 | 52 | 93 | 4.85 | |
| Safe LoraSetting=fine-tuning with explicit harmful data2026.05 | 52 | 99 | 4.97 | |
| SEALSetting=fine-tuning with explicit harmful data2026.05 | 52 | 98 | 4.97 | |
| BaseFine-tuning=none (original model)2026.05 | 34 | 4 | 1.16 |