Safety Evaluation on Do-Not-Answer
62.26MD RatePythia-2.8B + SFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Pythia-2.8B + SFTBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 62.26 | 18.44 | |
| Pythia-2.8BBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 59.7 | 18.34 | |
| Llama-3.2-3BBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 52.45 | 11.3 | |
| Llama-3.2-3B + SFTBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 51.71 | 27.72 | |
| Pythia-2.8B + cDPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 47.55 | 13.33 | |
| Pythia-2.8B + DPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 46.26 | 14.5 | |
| Pythia-2.8B + IPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 44.99 | 16.52 | |
| Pythia-2.8B + rDPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 39.23 | 14.29 | |
| Llama-3.2-3B + cDPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 11.51 | 5.54 | |
| Pythia-2.8B + Dr.DPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 8.96 | 1.28 | |
| Pythia-2.8B + wDPOBackbone=Pythia-2.8B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 6.82 | 1.07 | |
| Llama-3.2-3B + DPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 5.01 | 2.03 | |
| Llama-3.2-3B + IPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 3.73 | 1.71 | |
| Llama-3.2-3B + rDPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 1.17 | 0.64 | |
| Llama-3.2-3B + Dr.DPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 1.07 | 0 | |
| Llama-3.2-3B + wDPOBackbone=Llama-3.2-3B, Training Dataset=PKU-SafeRLHF-30K2026.03 | 0.64 | 0 |