Harmlessness on GPT-4 Evaluation Template T2 (overall)
89.99Win RateSafeDPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeDPOJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 89.99 | 7.7 | 2.31 | |
| SafeRLHFJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 84.85 | 6.8 | 8.34 | |
| DPO-HARMLESSJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 69.47 | 22.12 | 8.41 | |
| DPO-SAFEBETTERJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 57.61 | 19.25 | 23.15 | |
| DPO-HELPFULJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 33.59 | 24.58 | 41.83 |