Personalized response selection on PCogAlignBench Average
4.154P ScorePCogAlign
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PCogAlignStrategy=Full2025.06 | 4.154 | 5,380 | |
| PCogAlign (S)Strategy=SFT2025.06 | 4.118 | 5,130 | |
| Self-Refine (S)Strategy=SFT2025.06 | 4.113 | 5,140 | |
| PCogAlign (P)Strategy=Prompt2025.06 | 4.063 | 4,890 | |
| RLAIF (S)Strategy=SFT2025.06 | 4.033 | 4,560 | |
| PCogAlign (D)Strategy=DPO2025.06 | 4.024 | 4,690 | |
| RS PromptStrategy=Prompt2025.06 | 3.999 | 4,560 | |
| Self-Refine (D)Strategy=DPO2025.06 | 3.996 | 4,530 | |
| RLCD (D)Strategy=DPO2025.06 | 3.996 | 4,540 | |
| RLAIF (D)Strategy=DPO2025.06 | 3.996 | 4,570 | |
| RAGStrategy=Prompt2025.06 | 3.992 | 4,510 | |
| RLCD (S)Strategy=SFT2025.06 | 3.98 | 4,370 | |
| RS Prompt (S)Strategy=SFT2025.06 | 3.924 | 3,950 | |
| BaseStrategy=Prompt2025.06 | 3.748 | 0 |