Personalized response selection on PCogAlignBench LS2->LS2
4.151P ScorePCogAlign
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PCogAlignStrategy=Full2025.06 | 4.151 | 5,380 | |
| Self-Refine (S)Strategy=SFT2025.06 | 4.139 | 5,240 | |
| PCogAlign (S)Strategy=SFT2025.06 | 4.118 | 5,190 | |
| PCogAlign (P)Strategy=Prompt2025.06 | 4.056 | 5,030 | |
| RLAIF (S)Strategy=SFT2025.06 | 4.043 | 4,650 | |
| PCogAlign (D)Strategy=DPO2025.06 | 4.029 | 4,810 | |
| RLAIF (D)Strategy=DPO2025.06 | 4.011 | 4,840 | |
| RS PromptStrategy=Prompt2025.06 | 4.008 | 4,710 | |
| RLCD (D)Strategy=DPO2025.06 | 4.006 | 4,710 | |
| Self-Refine (D)Strategy=DPO2025.06 | 4.005 | 4,640 | |
| RS Prompt (S)Strategy=SFT2025.06 | 3.969 | 4,250 | |
| RLCD (S)Strategy=SFT2025.06 | 3.965 | 4,430 | |
| RAGStrategy=Prompt2025.06 | 3.952 | 4,580 | |
| BaseStrategy=Prompt2025.06 | 3.715 | 0 |