Helpfulness on Template T3 GPT-4 evaluation (test)
91.62Win RateSafeDPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SafeDPOJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 91.62 | 1.12 | 7.25 | |
| SafeRLHFJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 67.5 | 8.75 | 23.75 | |
| DPO-HARMLESSJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 65.88 | 16.75 | 17.38 | |
| DPO-SAFEBETTERJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 64.25 | 28 | 7.75 | |
| DPO-HELPFULJudge Model=GPT-4, Evaluation Template=T3, Comparison Baseline=SFT model2025.05 | 46.62 | 35.25 | 18.12 |