Reward Modeling on Internal preference benchmark (hold-out)
81.2Human AgreementSkywork-Reward-V2-Llama-3.1-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8BBackbone=Llama-3.1-8B2025.07 | 81.2 | |
| Skywork-Reward-V2-Qwen3-4BBackbone=Qwen3-4B2025.07 | 75.6 | |
| GPT-4o2025.07 | 74.3 | |
| Claude-3.5-Sonnet2025.07 | 72.1 | |
| Skywork-Reward-V2-Qwen3-1.7BBackbone=Qwen3-1.7B2025.07 | 71 |