Reward Modeling on Anthropic Harmless
74.7AccuracySafety RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Safety RMFine-tuned=true2023.07 | 74.7 | |
| Helpfulness RMFine-tuned=true2023.07 | 71 | |
| Open AssistantBackbone=DeBERTa V3 Large2023.07 | 68.4 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=62025.11 | 55.2 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=22025.11 | 54.6 | |
| UMM-RMBase Model=Pythia-1.4B, Activated Experts=42025.11 | 54.2 | |
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=62025.11 | 50.8 | |
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=42025.11 | 50.2 | |
| UMM-RMBase Model=Qwen2.5-0.5B, Activated Experts=22025.11 | 48.8 | |
| Dense RMBase Model=Pythia-1.4B2025.11 | 48 | |
| Dense RMBase Model=Qwen2.5-0.5B2025.11 | 38.6 | |
| SteamSHP-XLBackbone=FLAN-T5-xl2023.07 | 34.2 |