Correctness Evaluation on PPE Correctness (test)
87.2ScoreSkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40M2025.07 | 87.2 | — | — | |
| Skywork-Reward-V2-Llama-3.1-8B2025.07 | 83.4 | — | — | |
| Skywork-Reward-V2-Qwen3-8B2025.07 | 75.1 | — | — | |
| Skywork-Reward-V2-Qwen3-4B2025.07 | 74.7 | — | — | |
| J1-Llama-70B (Maj@32)Model Type=LLM-as-a-Judge, Sampling Strategy=Maj@322025.07 | 73.7 | — | — | |
| J1-Llama-70BModel Type=LLM-as-a-Judge2025.07 | 72.9 | — | — | |
| Skywork-Reward-V2-Llama-3.2-3B2025.07 | 72.1 | — | — | |
| Skywork-Reward-V2-Qwen3-1.7B2025.07 | 70.5 | — | — | |
| Claude-3.5-SonnetModel Type=LLM-as-a-Judge2025.07 | 69.2 | — | — | |
| Skywork-Reward-V2-Qwen3-0.6B2025.07 | 68.3 | — | — | |
| Skywork-Reward-V2-Llama-3.2-1B2025.07 | 67.4 | — | — | |
| GPT-4oModel Type=LLM-as-a-Judge2025.07 | 67.1 | — | — | |
| INF-ORM-Llama3.1-70BModel Type=Open Reward Model2025.07 | 64.4 | — | — | |
| Llama-3-OffsetBias-RM-8BModel Type=Open Reward Model2025.07 | 64.1 | — | — | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=Open Reward Model2025.07 | 63.9 | — | — | |
| Llama-3.1-Nemotron-70BModel Type=Open Reward Model2025.07 | 63.2 | — | — | |
| DeepSeek-GRM-27B (w/ MetaRM)Model Type=Generative Reward Model2025.07 | 63.2 | — | — | |
| Internlm2-20b-rewardModel Type=Open Reward Model2025.07 | 63 | — | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=Open Reward Model2025.07 | 62.5 | — | — | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=Open Reward Model2025.07 | 61.9 | — | — | |
| J1-Llama-8B (Maj@32)Model Type=LLM-as-a-Judge, Sampling Strategy=Maj@322025.07 | 61.9 | — | — | |
| ArmoRM-Llama3-8B-v0.1Model Type=Open Reward Model2025.07 | 60.6 | — | — | |
| DeepSeek-GRM-27BModel Type=Generative Reward Model2025.07 | 60.4 | — | — | |
| J1-Llama-8BModel Type=LLM-as-a-Judge2025.07 | 59.2 | — | — | |
| ConsistencyModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | — | 0.3212 | 0.2978 | |
| ConsistencyModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | — | 0.0932 | 0.098 | |
| MajorityModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | — | 0.3197 | 0.294 | |
| MajorityModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | — | 0.099 | 0.1034 | |
| ProbeModel=LLAMA Scout (109B)2025.12 | — | 0.0643 | 0.0684 | |
| ProbeModel=GPT-OSS 20B2025.12 | — | 0.0689 | 0.1193 | |
| VerbalizedModel=LLAMA Scout (109B)2025.12 | — | 0.1931 | 0.1597 | |
| VerbalizedModel=GPT-OSS 20B2025.12 | — | 0.1462 | 0.152 |