Preference Prediction on PPE Preference (test)
79.8Preference ScoreSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40M2025.07 | 79.8 | |
| Skywork-Reward-V2-Llama-3.1-8B2025.07 | 77.3 | |
| Skywork-Reward-V2-Qwen3-8B2025.07 | 70.6 | |
| Skywork-Reward-V2-Qwen3-4B2025.07 | 69.5 | |
| Skywork-Reward-V2-Llama-3.2-3B2025.07 | 69.1 | |
| GPT-4oModel Type=LLM-as-a-Judge2025.07 | 67.7 | |
| Skywork-Reward-V2-Qwen3-1.7B2025.07 | 67.6 | |
| Claude-3.5-SonnetModel Type=LLM-as-a-Judge2025.07 | 67.3 | |
| DeepSeek-GRM-27B (w/ MetaRM)Model Type=Generative Reward Model2025.07 | 67.2 | |
| J1-Llama-70B (Maj@32)Model Type=LLM-as-a-Judge, Sampling Strategy=Maj@322025.07 | 67 | |
| Skywork-Reward-V2-Llama-3.2-1B2025.07 | 66.6 | |
| J1-Llama-70BModel Type=LLM-as-a-Judge2025.07 | 66.3 | |
| DeepSeek-GRM-27BModel Type=Generative Reward Model2025.07 | 65.3 | |
| Skywork-Reward-V2-Qwen3-0.6B2025.07 | 65.3 | |
| Llama-3.1-Nemotron-70BModel Type=Open Reward Model2025.07 | 64.2 | |
| INF-ORM-Llama3.1-70BModel Type=Open Reward Model2025.07 | 64.2 | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=Open Reward Model2025.07 | 63.6 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=Open Reward Model2025.07 | 62.4 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=Open Reward Model2025.07 | 62.2 | |
| Internlm2-20b-rewardModel Type=Open Reward Model2025.07 | 61 | |
| ArmoRM-Llama3-8B-v0.1Model Type=Open Reward Model2025.07 | 60.6 | |
| J1-Llama-8B (Maj@32)Model Type=LLM-as-a-Judge, Sampling Strategy=Maj@322025.07 | 60.6 | |
| J1-Llama-8BModel Type=LLM-as-a-Judge2025.07 | 60.3 | |
| Llama-3-OffsetBias-RM-8BModel Type=Open Reward Model2025.07 | 59.2 |