Reward Modeling on Meta Safety (test)
64.5AccuracySafety RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Safety RMFine-tuned=true2023.07 | 64.5 | |
| Helpfulness RMFine-tuned=true2023.07 | 62.8 | |
| GPT4zero-shot=true2023.07 | 58.1 | |
| Open AssistantBackbone=DeBERTa V3 Large2023.07 | 53.4 | |
| SteamSHP-XLBackbone=FLAN-T5-xl2023.07 | 43.8 |