Personalized response selection on PCogAlignBench LS1->LS2
4.156P. ScorePCogAlign
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PCogAlignStrategy=Full2025.06 | 4.156 | 56.6 | |
| PCogAlign (S)Strategy=SFT2025.06 | 4.108 | 53 | |
| Self-Refine (S)Strategy=SFT2025.06 | 4.096 | 52 | |
| PCogAlign (P)Strategy=Prompt2025.06 | 4.056 | 50.3 | |
| PCogAlign (D)Strategy=DPO2025.06 | 4.039 | 49.1 | |
| RLCD (D)Strategy=DPO2025.06 | 4.014 | 46.7 | |
| RS PromptStrategy=Prompt2025.06 | 4.008 | 47.1 | |
| Self-Refine (D)Strategy=DPO2025.06 | 4.007 | 47.2 | |
| RLAIF (D)Strategy=DPO2025.06 | 4.005 | 46.9 | |
| RLAIF (S)Strategy=SFT2025.06 | 3.994 | 48.7 | |
| RAGStrategy=Prompt2025.06 | 3.949 | 44.3 | |
| RLCD (S)Strategy=SFT2025.06 | 3.941 | 44.4 | |
| RS Prompt (S)Strategy=SFT2025.06 | 3.937 | 41.6 | |
| BaseStrategy=Prompt2025.06 | 3.715 | 0 |