ResearchBenchmarksPersonalized LLM response generation on Koala (test)Follow88Win Rate (Reward Model)CLIPer52.296861.565970.83580.1041May 8, 2026Evaluation ResultsMethodMethodLinksWin Rate (Reward Model)Win Rate (GPT-4o-mini)Average Win RateCLIPerComparison Baseline=Va...Comparison Baseline=Vanilla Baseline, Preference Dimension=1-dim2026.058884.3383.42CLIPerComparison Baseline=p-...Comparison Baseline=p-soup & Direct Fine-tuning, Preference Dimension=1-dim2026.0578.6739.6758CLIPerComparison Baseline=Di...Comparison Baseline=Direct Prompting, Preference Dimension=1-dim2026.0553.675553