Preference Alignment on PKU-SafeRLHF (test)
28.69Win RateQwen-1.7B-DPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen-1.7B-DPOJudge=DeepSeek-V3 API2025.12 | 28.69 | 53.95 | 17.35 | |
| Qwen-1.7B-SGRPOJudge=DeepSeek-V3 API2025.12 | 22.82 | 52.09 | 25.09 | |
| Qwen-1.7B-SFTJudge=DeepSeek-V3 API2025.12 | 0.95 | 2.41 | 96.62 |