Preference Evaluation on RMB Best-of-N
86.2Helpfulness Score (BoN)Skywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40MBackbone=Llama-3.1-8B, Training Data=SynPref-40M2025.07 | 86.2 | 86.6 | 86.4 | |
| Skywork-Reward-V2-Llama-3.1-8BBackbone=Llama-3.1, Parameters=8B2025.07 | 82.3 | 82.8 | 82.5 | |
| Skywork-Reward-V2-Qwen3-8BBackbone=Qwen3, Parameters=8B2025.07 | 76.5 | 75.8 | 76.2 | |
| Skywork-Reward-V2-Qwen3-4BBackbone=Qwen3, Parameters=4B2025.07 | 74.7 | 75.1 | 74.9 | |
| Skywork-Reward-V2-Llama-3.2-3BBackbone=Llama-3.2, Parameters=3B2025.07 | 74.4 | 76.2 | 75.3 | |
| Skywork-Reward-V2-Qwen3-1.7BBackbone=Qwen3, Parameters=1.7B2025.07 | 72 | 72.2 | 72.1 | |
| Skywork-Reward-V2-Qwen3-0.6BBackbone=Qwen3, Parameters=0.6B2025.07 | 68.4 | 69.1 | 68.8 | |
| Skywork-Reward-V2-Llama-3.2-1BBackbone=Llama-3.2, Parameters=1B2025.07 | 68 | 73.2 | 70.6 | |
| Qwen2-72B-InstructBackbone=Qwen2-72B-Instruct2025.07 | 64.5 | 64.9 | 64.7 | |
| DeepSeek-GRM-27B + MetaRMBackbone=DeepSeek-27B, Augmentation=MetaRM2025.07 | 64.2 | 58 | 61.1 | |
| DeepSeek-GRM-27BBackbone=DeepSeek-27B2025.07 | 63.9 | 58 | 61 | |
| GPT-4o-2024-05-03Version=2024-05-032025.07 | 63.9 | 68.2 | 66.1 | |
| RM-R1-Qwen-Instruct-32BBackbone=Qwen-Instruct-32B, Source=R12025.07 | 63.6 | 68.2 | 65.9 | |
| Skywork-Reward-Gemma-2-27B-v0.2Backbone=Gemma-2-27B, Version=v0.22025.07 | 63.1 | 59.9 | 61.5 | |
| RM-R1-DeepSeek-Distill-Qwen-32BBackbone=Qwen-32B, Distillation Source=DeepSeek-R12025.07 | 62 | 61.8 | 61.9 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B, Version=v0.22025.07 | 60.5 | 56.8 | 58.7 |