ResearchBenchmarksPersona-based Summarization on Amazon ReviewsFollow0.722RefBS-RRL0.713160.7154550.717750.720045Dec 12, 2025Evaluation ResultsMethodMethodLinksRefBS-RRevBS-PPersBS-RRLTraining Mode=Reinforc...Training Mode=Reinforcement Learning, Optimization=PPO2025.120.7220.75160.8345SFTTraining Mode=Supervis...Training Mode=Supervised Fine-Tuning, Framework=Tinker Cookbook2025.120.71850.75420.8238IPTFull Name=Instruction...Full Name=Instruction Prompt Tuning Model2025.120.71460.76060.8172BaseBackbone=Qwen-4BBackbone=Qwen-4B2025.120.71350.76180.8257