Reward Modeling on RMB (test)
89.3ScoreSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40M2025.07 | 89.3 | |
| Skywork-Reward-V2-Llama-3.1-8B2025.07 | 86.4 | |
| Skywork-Reward-V2-Qwen3-8B2025.07 | 81.2 | |
| Skywork-Reward-V2-Qwen3-4B2025.07 | 80.6 | |
| Skywork-Reward-V2-Llama-3.2-3B2025.07 | 80.5 | |
| Skywork-Reward-V2-Qwen3-1.7B2025.07 | 78.1 | |
| Skywork-Reward-V2-Llama-3.2-1B2025.07 | 76.7 | |
| Skywork-Reward-V2-Qwen3-0.6B2025.07 | 74.5 | |
| GPT-4oModel Type=LLM-as-a-Judge2025.07 | 73.8 | |
| RM-R1-Qwen-Instruct-32BModel Type=Generative Reward Model2025.07 | 73 | |
| Claude-3.5-SonnetModel Type=LLM-as-a-Judge2025.07 | 70.6 | |
| INF-ORM-Llama3.1-70BModel Type=Open Reward Model2025.07 | 70.5 | |
| DeepSeek-GRM-27B (w/ MetaRM)Model Type=Generative Reward Model2025.07 | 70.3 | |
| RM-R1-DeepSeek-Distill-Qwen-32BModel Type=Generative Reward Model2025.07 | 69.8 | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=Open Reward Model2025.07 | 69.4 | |
| DeepSeek-GRM-27BModel Type=Generative Reward Model2025.07 | 69 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=Open Reward Model2025.07 | 67.9 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=Open Reward Model2025.07 | 66.6 | |
| Llama-3.1-Nemotron-70BModel Type=Open Reward Model2025.07 | 64.9 | |
| ArmoRM-Llama3-8B-v0.1Model Type=Open Reward Model2025.07 | 64.6 | |
| Internlm2-20b-rewardModel Type=Open Reward Model2025.07 | 62.9 | |
| Llama-3-OffsetBias-RM-8BModel Type=Open Reward Model2025.07 | 57.8 |