Helpfulness on GPT-4 Evaluation Template T2 (overall)
91.6Win RateSafeDPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeDPOJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 91.6 | 0.64 | 7.76 | |
| SafeRLHFJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 85.51 | 1.42 | 13.07 | |
| DPO-SAFEBETTERJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 75.95 | 11.27 | 12.78 | |
| DPO-HARMLESSJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 72.58 | 8.67 | 18.75 | |
| DPO-HELPFULJudge Model=GPT-4, Evaluation Template=T2, Comparison Baseline=SFT2025.05 | 58.88 | 16.73 | 24.39 |