Watch duration prediction on Persona A
0.617SMAPEPersonaAct (SFT+GRPO)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PersonaAct (SFT+GRPO)training=SFT followed by GRPO2026.01 | 0.617 | 5.1 | |
| SFTtraining=Supervised Fine-Tuning2026.01 | 0.683 | 5.61 | |
| LLM Sim2026.01 | 1.161 | 6.69 | |
| GRPOtraining=Group Relative Policy Optimization2026.01 | 1.305 | 6.26 |