Multi-objective alignment on Helpful Assistant (test)
0.76Helpfulness ScoreRLHF-r1
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| RLHF-r1Targeted Reward=r12025.05 | 0.76 | -0.42 | -0.23 | |
| MOPO-LagVariation=Lagrangian2025.05 | 0.39 | 0.22 | 0.17 | |
| PARM2025.05 | 0.31 | 0.17 | 0.23 | |
| MOPO-LBVariation=LB2025.05 | 0.3 | 0.19 | 0.18 | |
| RiC2025.05 | 0.25 | 0.15 | 0.11 | |
| DPO on DJDataset=DJ2025.05 | 0.18 | 0.09 | 0.11 | |
| MODPO2025.05 | 0.04 | -0.09 | 0.08 | |
| RLHF-r3Targeted Reward=r32025.05 | -0.79 | -0.92 | 0.42 | |
| RLHF-r2Targeted Reward=r22025.05 | -0.81 | 0.53 | -0.4 |