Reward Modeling on Stanford Human Preferences (SHP)
80AccuracyHelpfulness RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Helpfulness RMFine-tuned=true2023.07 | 80 | |
| SteamSHP-XLBackbone=FLAN-T5-xl2023.07 | 75.7 | |
| Safety RMFine-tuned=true2023.07 | 65.2 | |
| Open AssistantBackbone=DeBERTa V3 Large2023.07 | 55 |