Helpfulness Evaluation on Helpfulness (evaluation set)
84.05Win RateSafeDPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeDPOJudge Model=GPT-4, Evaluation Template=T12025.05 | 84.05 | 9.42 | 6.53 | |
| SafeRLHFJudge Model=GPT-4, Evaluation Template=T12025.05 | 77.74 | 11.19 | 11.07 | |
| DPO-HARMLESSJudge Model=GPT-4, Evaluation Template=T12025.05 | 65.12 | 21.08 | 13.8 | |
| DPO-SAFEBETTERJudge Model=GPT-4, Evaluation Template=T12025.05 | 55.65 | 31.66 | 12.69 | |
| DPO-HELPFULJudge Model=GPT-4, Evaluation Template=T12025.05 | 37.77 | 39.15 | 23.09 |