Harmlessness on Template T3 GPT-4 evaluation (test)
87.5Win RateSafeDPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeDPOJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 87.5 | 10.38 | 2.12 | |
| SafeRLHFJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 68.75 | 19.38 | 11.88 | |
| DPO-HARMLESSJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 58.38 | 33.25 | 8.38 | |
| DPO-SAFEBETTERJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 43.88 | 45.5 | 10.62 | |
| DPO-HELPFULJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 27.62 | 49.62 | 22.75 |