LLM Evaluation on JudgeBench (test)
79.9KnowledgeSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40Mbackbone=Llama-3.1, parameters=8B, training_data=40M2025.07 | 79.9 | 78.6 | 89.3 | 85.7 | 83.4 | |
| Skywork-Reward-V2-Llama-3.1-8Bbackbone=Llama-3.1, parameters=8B2025.07 | 76.6 | 75.5 | 89.3 | 78.6 | 80 | |
| Skywork-Reward-V2-Qwen3-8Bbackbone=Qwen3, parameters=8B2025.07 | 70.1 | 67.3 | 82.1 | 73.8 | 73.3 | |
| o3-minieffort=high2025.07 | 67.5 | 89.8 | 87.5 | 100 | 86.2 | |
| Skywork-Reward-V2-Qwen3-1.7Bbackbone=Qwen3, parameters=1.7B2025.07 | 66.9 | 69.4 | 83.9 | 71.4 | 72.9 | |
| Skywork-Reward-V2-Qwen3-4Bbackbone=Qwen3, parameters=4B2025.07 | 66.9 | 64.3 | 80.4 | 66.7 | 69.5 | |
| o1-preview2025.07 | 66.2 | 79.6 | 85.7 | 85.7 | 79.3 | |
| Skywork-Reward-V2-Llama-3.2-3Bbackbone=Llama-3.2, parameters=3B2025.07 | 64.3 | 65.3 | 87.5 | 59.5 | 69.2 | |
| o3-minieffort=low2025.07 | 63 | 69.4 | 83.4 | 83.3 | 74.8 | |
| Claude-3.5-Sonnet2025.07 | 62.3 | 66.3 | 66.1 | 64.3 | 64.8 | |
| o3-minieffort=medium2025.07 | 62.3 | 86.7 | 85.7 | 92.9 | 81.9 | |
| Skywork-Reward-V2-Qwen3-0.6Bbackbone=Qwen3, parameters=0.6B2025.07 | 62.3 | 66.3 | 82.1 | 59.5 | 67.5 | |
| Skywork-Reward-V2-Llama-3.2-1Bbackbone=Llama-3.2, parameters=1B2025.07 | 61 | 66.3 | 73.2 | 59.5 | 65 | |
| DeepSeek-R12025.07 | 59.1 | 82.7 | 80.4 | 92.9 | 78.8 | |
| o3-mini2025.07 | 58.4 | 62.2 | 82.1 | 78.6 | 70.3 | |
| GPT-4o2025.07 | 50.6 | 54.1 | 75 | 59.5 | 59.8 |