Preference Modeling on MultiPref held-out (test)
66.4Preference AccuracyMean-Var
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Mean-VarReward Model Type=Distributional, Loss=KL2024.10 | 66.4 | 0.615 | |
| Bradley-TerryReward Model Type=Single-Value, Data Scaling=Agg2024.10 | 66.3 | 0.458 | |
| SkyworkReward Model Type=Single-Value, Backbone=Gemma2-27B2024.10 | 65.1 | 0.494 | |
| Bradley-TerryReward Model Type=Single-Value, Data Scaling=All2024.10 | 64.8 | 0.438 | |
| NemotronReward Model Type=Single-Value, Backbone=Llama3.1-70B2024.10 | 63.8 | 0.4 | |
| Mean-VarReward Model Type=Distributional, Loss=NLL, Independence=Independent2024.10 | 53.3 | 0.549 |