LLM-as-a-Judge Evaluation on JudgeBench (test)
83.4ScoreSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40M2025.07 | 83.4 | |
| Skywork-Reward-V2-Llama-3.1-8B2025.07 | 80 | |
| Skywork-Reward-V2-Qwen3-8B2025.07 | 73.4 | |
| Skywork-Reward-V2-Qwen3-1.7B2025.07 | 72.9 | |
| INF-ORM-Llama3.1-70BModel Type=Open Reward Model2025.07 | 70.2 | |
| Skywork-Reward-V2-Qwen3-4B2025.07 | 69.5 | |
| Skywork-Reward-V2-Llama-3.2-3B2025.07 | 69.2 | |
| Skywork-Reward-V2-Qwen3-0.6B2025.07 | 67.6 | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=Open Reward Model2025.07 | 66.5 | |
| Llama-3.1-Nemotron-70BModel Type=Open Reward Model2025.07 | 65.8 | |
| Skywork-Reward-V2-Llama-3.2-1B2025.07 | 65 | |
| Claude-3.5-SonnetModel Type=LLM-as-a-Judge2025.07 | 64.8 | |
| Internlm2-20b-rewardModel Type=Open Reward Model2025.07 | 64.3 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=Open Reward Model2025.07 | 64.2 | |
| Llama-3-OffsetBias-RM-8BModel Type=Open Reward Model2025.07 | 63.5 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=Open Reward Model2025.07 | 62.9 | |
| J1-Llama-70BModel Type=LLM-as-a-Judge2025.07 | 60 | |
| GPT-4oModel Type=LLM-as-a-Judge2025.07 | 59.8 | |
| ArmoRM-Llama3-8B-v0.1Model Type=Open Reward Model2025.07 | 59.7 | |
| EvalPlanner (Llama-3.3-70B)Model Type=LLM-as-a-Judge2025.07 | 56.6 | |
| EvalPlanner (Llama-3.1-70B)Model Type=LLM-as-a-Judge2025.07 | 50.9 | |
| J1-Llama-8BModel Type=LLM-as-a-Judge2025.07 | 42 |