Reward Modeling on RMB (Overall, Help, Harm Accuracy)
88.6Help AccuracyCDRRM-14B (SFT)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| CDRRM-14B (SFT)Model Category=Ours (CDRRM), Model Size=14B, Training Stage=SFT2026.03 | 88.6 | 84.4 | 80.3 | |
| CDRRM-8B (SFT)Model Category=Ours (CDRRM), Model Size=8B, Training Stage=SFT2026.03 | 88.1 | 83.2 | 78.4 | |
| CDRRM-14B (Base)Model Category=Ours (CDRRM), Model Size=14B, Training Stage=Base2026.03 | 86.5 | 83.7 | 79.7 | |
| CDRRM-8B (Base)Model Category=Ours (CDRRM), Model Size=8B, Training Stage=Base2026.03 | 85.3 | 80.8 | 76.3 | |
| DeepSeek-GRM-27BModel Category=GenRMs, Model Size=27B2026.03 | 80.5 | 78.3 | 76.1 | |
| INF-ORM-Llama3.1-70BModel Category=Scalar RMs, Model Size=70B2026.03 | 79.8 | 78.3 | 76.7 | |
| RM-R1-Qwen-Instruct-32BModel Category=Rubric-based RMs, Model Size=32B2026.03 | 79.1 | 80 | 80.9 | |
| ArmoRM-Llama3-8B-v0.1Model Category=Scalar RMs, Model Size=8B2026.03 | 78.7 | 72.5 | 66.3 | |
| Skywork-Reward-Llama-3.1-8BModel Category=Scalar RMs, Model Size=8B2026.03 | 78.1 | 77 | 75.9 | |
| BR-RM-Qwen-8BModel Category=GenRMs, Model Size=8B2026.03 | 76.9 | 79.6 | 82.2 | |
| InternLM2-20B-RewardModel Category=Scalar RMs, Model Size=20B2026.03 | 76.3 | 71.7 | 67 | |
| Skywork-Critic-Llama-3.1-70BModel Category=GenRMs, Model Size=70B2026.03 | 75.3 | 68.4 | 61.4 | |
| SteerLM-RM-70BModel Category=Scalar RMs, Model Size=70B2026.03 | 57.4 | 62.4 | 67.3 |