ResearchBenchmarksPersonalized Dialogue Generation on Session-level evaluation dataset 1.0 (test)Follow83.78Personalization ConsistencyMuse30.802444.556258.3172.0638Apr 15, 2026Evaluation ResultsMethodMethodLinksPersonalization ConsistencyGoal EffectivenessDialogue CoherenceConstraint ComplianceAverage ScoreMuseRL Stage=IncludedRL Stage=Included2026.0483.7879.6786.8587.3984.42GPT-4o2026.0476.2575.8681.8778.3478.08Qwen3-8B2026.0474.1562.5671.5971.8170.03Muse (w/o RL)RL Stage=ExcludedRL Stage=Excluded2026.0468.1364.1472.7368.2568.31USP2026.0442.6658.8276.9240.3854.69UserLM2026.0432.8452.0863.3629.4244.42