Reward Modeling on PPE Human
64.6AccuracyAthene-RM-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Athene-RM-8BSize=8B2026.02 | 64.6 | |
| Llama-3.1-Nemotron-70BSize=70B2026.02 | 64.2 | |
| INF-ORM-Llama3.1-70BBackbone=Llama3.1-70B2026.02 | 64.2 | |
| Skywork-Reward-Gemma-2-27B-v0.2Backbone=Gemma-2-27B2026.02 | 63.6 | |
| WILDREWARD-8BSize=8B2026.02 | 62.5 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B2026.02 | 62.2 | |
| WILDREWARD-4BSize=4B2026.02 | 61.6 | |
| Internlm2-20b-rewardSize=20b2026.02 | 61 | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama3-8B2026.02 | 60.6 | |
| Llama-3-OffsetBias-RM-8BSize=8B2026.02 | 59.2 |