Personalized Generation on BESPOKE
9.94R-LP-CHECK
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| P-CHECKAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 9.94 | 9.67 | 61.21 | |
| P-CHECKAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 9.61 | 8.47 | 57.32 | |
| P-CHECKAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 9.43 | 8.22 | 59.76 | |
| VPLAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 8.68 | 7.7 | 53.55 | |
| VPLAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 8.45 | 7.49 | 53.36 | |
| CoT distillAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 8.41 | 7.63 | 56.64 | |
| PALAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 8.32 | 7.1 | 51.68 | |
| PALAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 8.31 | 7.46 | 52.03 | |
| CoT distillAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 8.24 | 7.14 | 54.9 | |
| CoT distillAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 8.24 | 7.62 | 54.76 | |
| VPLAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 8.05 | 7.06 | 52.19 | |
| SynthMeAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 8.01 | 6.46 | 52.96 | |
| SynthMeAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 7.99 | 6.85 | 52.06 | |
| Default PolicyAlign. Method=Best-of-N Selection (BoN), Policy π=Llama3-8b2026.01 | 7.92 | 6.09 | 51.55 | |
| Default PolicyAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 7.92 | 6.09 | 51.55 | |
| Default PolicyAlign. Method=Best-of-N Selection (BoN), Policy π=GPT-4o-mini2026.01 | 7.83 | 6.43 | 51.69 | |
| SynthMeAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 7.74 | 6.45 | 52.46 | |
| PALAlign. Method=DPO, Policy π=Llama3-8b2026.01 | 7.42 | 6.11 | 53.49 |