Personalized Text Generation on Amazon Review
100User-level Accuracy (GT)PARL-0
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| PARL-0Optimization=Scoring function S(yi; Ru) only2026.05 | 100 | 100 | 99.8 | 100 | 100 | 100 | 100 | 100 | 0 | 100 | |
| LM-8BModel=Qwen3-8B, Variant=Pre-trained generator2026.05 | 93.1 | 54.8 | 62.4 | 60.1 | 74 | 82.7 | 93 | 91.7 | 0.001 | 49.1 | |
| PARL-AOptimization=GT-scaled reward (RA)2026.05 | 93.1 | 27.2 | 32.5 | 22.5 | 33 | 87.7 | 83.2 | 90.5 | 0.026 | 99.3 | |
| PARL-BOptimization=Margin-only reward (RB)2026.05 | 93 | 56.7 | 61.6 | 57.9 | 66.9 | 88 | 91.8 | 92.7 | 0.003 | 99.5 | |
| LM-235BModel=Qwen3-235B-A22B-Instruct, Variant=Pre-trained generator2026.05 | 79.4 | 25.6 | 34.4 | 28 | 42 | 64.2 | 78.7 | 75.9 | 0.007 | 84.6 |