Reward Modeling on RewardBench latest (full)
93.6Average ScoreBNBT-Reward-Llama-3.1-8B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| BNBT-Reward-Llama-3.1-8BType=Discriminative2026.02 | 93.6 | 95.3 | 89.7 | 92.6 | 96.9 | |
| SFR-LLaMa-3.1-70B-Judge-IType=Generative2026.02 | 92.7 | 96.9 | 84.8 | 91.6 | 97.6 | |
| Skywork-Reward-Llama-3.1-8BType=Discriminative2026.02 | 92.5 | 95.8 | 87.3 | 90.6 | 96.5 | |
| Nemotron-340B-RewardType=Discriminative2026.02 | 92.2 | 95.8 | 87.1 | 92.2 | 93.6 | |
| Skywork-1-1BT-RM-8BType=Discriminative2026.02 | 91.8 | 94.6 | 84.5 | 91.5 | 96.5 | |
| ArmoRM-Llama3-8B-v0.1Type=Discriminative2026.02 | 90.8 | 96.9 | 76.8 | 92.2 | 97.3 | |
| SFR-nemo-12B-Judge-rType=Generative2026.02 | 90.3 | 97.2 | 82.2 | 86.5 | 95.1 | |
| InternLM-20B-RewardType=Discriminative2026.02 | 90.2 | 98.9 | 76.5 | 89.9 | 95.8 | |
| Llama-3-OffsetBias-RM-8BType=Discriminative2026.02 | 89.4 | 97.2 | 81.8 | 86.8 | 91.9 | |
| Gemini-1.5Type=Generative2026.02 | 86.8 | 94.1 | 77 | 85.8 | 90.2 | |
| GPT-4oType=Generative2026.02 | 86.7 | 96.1 | 76.1 | 88.1 | 86.6 |