LLM Safety Alignment on PKU-SafeRLHF full deduplicated (test)
8.22HelpfulnessCat-DPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Cat-DPOBackbone=Alpaca-7B2026.04 | 8.22 | 9.35 | 95.2 | 96.8 | |
| SafeDPOBackbone=Alpaca-7B2026.04 | 8.09 | 9.21 | 94.3 | 95.6 | |
| DPO-bettersafeBackbone=Qwen3-4B2026.04 | 7.94 | 9.28 | 98 | 98.1 | |
| Cat-DPOBackbone=Qwen3-4B2026.04 | 7.94 | 9.4 | 98.8 | 98.5 | |
| DPO-harmlessBackbone=Alpaca-7B2026.04 | 7.8 | 8.96 | 91.8 | 94.2 | |
| DPO-harmlessBackbone=Qwen3-4B2026.04 | 7.8 | 9.42 | 99 | 99.1 | |
| DPO-bettersafeBackbone=Alpaca-7B2026.04 | 7.75 | 8.88 | 89.7 | 92.2 | |
| SafeDPOBackbone=Qwen3-4B2026.04 | 7.56 | 8.96 | 95.3 | 96.9 | |
| SACPOBackbone=Alpaca-7B2026.04 | 7.49 | 8.88 | 93 | 95.2 | |
| SACPOBackbone=Qwen3-4B2026.04 | 7.46 | 9.19 | 98.7 | 99.5 | |
| DPO-helpfulBackbone=Qwen3-4B2026.04 | 7.3 | 8.83 | 93.6 | 95.2 | |
| DPO-helpfulBackbone=Alpaca-7B2026.04 | 6.95 | 7.94 | 78.2 | 82.4 |