Reward Modeling on OpenAI Summarization
75.5AccuracyHelpfulness RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Helpfulness RMFine-tuned=true2023.07 | 75.5 | |
| Open AssistantBackbone=DeBERTa V3 Large2023.07 | 71.7 | |
| Safety RMFine-tuned=true2023.07 | 71.7 | |
| SteamSHP-XLBackbone=FLAN-T5-xl2023.07 | 54.7 |