Reward Modeling Accuracy on RewardBench
97.8AccuracySkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 97.8 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 96.4 | |
| INF-ORM-Llama3.1-70BBackbone=Llama3.1-70B2026.02 | 95.1 | |
| INF-ORM-Llama3.1-70BModel Type=ScalarRM, Backbone=Llama-3.1-70B2026.02 | 95.1 | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 95.1 | |
| INF-ORM-Llama3.1-70BReward Model Category=ScalarRMs2025.05 | 95.1 | |
| INF-ORM-Llama3.1-70BModel Category=Scalar RMs, Model Size=70B2026.03 | 95.1 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=ScalarRM, Backbone=Gemma-2-27B2026.02 | 95 | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 95 | |
| QRM-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 94.4 | |
| Skywork-Reward-Gemma-2-27B-v0.2Backbone=Gemma-2-27B, Version=v0.22026.02 | 94.3 | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=ScalarRM, Backbone=Gemma-2-27B2026.02 | 94.3 | |
| Skywork-Reward-Gemma-2-27B-v0.2Paradigm=Bradley-Terry2025.07 | 94.3 | |
| Llama-3.1-Nemotron-70BSize=70B2026.02 | 93.9 | |
| Llama-3.1-Nemotron-70BModel Type=ScalarRM, Backbone=Llama-3.1-70B2026.02 | 93.9 | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 93.9 | |
| EvalPlannerParadigm=LLM-as-a-Judge & Generative Reward Models, Backbone=Llama-3.1-70B2025.07 | 93.9 | |
| Skywork-Reward-Gemma-2-27BModel=Skywork-Reward-Gemma-2-27B, Source (Reported vs. Reproduced)=Reported2026.02 | 93.8 | |
| Skywork-Reward-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 93.8 | |
| EvalPlannerParadigm=LLM-as-a-Judge & Generative Reward Models, Backbone=Llama-3.3-70B2025.07 | 93.8 | |
| Skywork-Reward-Gemma-2-27BReward Model Category=ScalarRMs2025.05 | 93.8 | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 93.7 | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 93.4 | |
| J1-Llama-70BModel Type=GenRM, Backbone=Llama-70B2026.02 | 93.3 | |
| J1-Llama-70BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 93.3 | |
| Skywork-Critic-Llama-3.1-70BReward Model Category=GenRMs2025.05 | 93.3 | |
| Skywork-Critic-Llama-3.1-70BModel Category=GenRMs, Model Size=70B2026.03 | 93.3 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B, Version=v0.22026.02 | 93.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=ScalarRM, Backbone=Llama-3.1-8B2026.02 | 93.1 | |
| QRM-Llama3.1-8B-v2Paradigm=Bradley-Terry2025.07 | 93.1 | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 93.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Paradigm=Bradley-Terry2025.07 | 93.1 | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 93 | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 92.9 | |
| RM-R1-Qwen-Instruct-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 92.9 | |
| CAMEL-ReflectionModel Type=GenRM, Method Variant=+ Reflection2026.02 | 92.8 | |
| CDRRM-14B (SFT)Model Category=Ours (CDRRM), Model Size=14B, Training Stage=SFT2026.03 | 92.8 | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 92.5 | |
| Skywork-Reward-Llama-3.1-8BReward Model Category=ScalarRMs2025.05 | 92.5 | |
| Skywork-Reward-Llama-3.1-8BModel Category=Scalar RMs, Model Size=8B2026.03 | 92.5 | |
| CDRRM-14B (Base)Model Category=Ours (CDRRM), Model Size=14B, Training Stage=Base2026.03 | 92.5 | |
| CAMELModel Type=GenRM2026.02 | 92.4 | |
| Nemotron-4-340B-RewardModel=Nemotron-4-340B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 92 | |
| Nemotron-4-340B-RewardReward Model Category=ScalarRMs2025.05 | 92 | |
| CDRRM-8B (SFT)Model Category=Ours (CDRRM), Model Size=8B, Training Stage=SFT2026.03 | 92 | |
| GRM-Llama3-8B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 91.5 | |
| RM-R1-QWEN-INSTRUCT-32BReward Model Category=Our Methods2025.05 | 91.4 | |
| RM-R1-Qwen-Instruct-32BModel Category=Rubric-based RMs, Model Size=32B2026.03 | 91.4 | |
| OPRM-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 91.3 | |
| BR-RM-Qwen-8BModel Category=GenRMs, Model Size=8B2026.03 | 91 | |
| RM-R1-DeepSeek-Distill-Qwen-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 90.9 | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-32BReward Model Category=Our Methods2025.05 | 90.9 | |
| CAMEL-FastModel Type=GenRM, Inference Protocol=1-token verdict2026.02 | 90.5 | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama3-8B, Version=v0.12026.02 | 90.4 | |
| ArmoRM-8B-v0.1Model=ArmoRM-8B-v0.1, Source (Reported vs. Reproduced)=Reported2026.02 | 90.4 | |
| ArmoRM-Llama3-8B-v0.1Model Type=ScalarRM, Backbone=Llama-3-8B2026.02 | 90.4 | |
| ArmoRM-Llama3-8B-v0.1Paradigm=Bradley-Terry2025.07 | 90.4 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models, Integration=w/ MetaRM2025.07 | 90.4 | |
| ArmoRM-Llama3-8B-v0.1Reward Model Category=ScalarRMs2025.05 | 90.4 | |
| ArmoRM-Llama3-8B-v0.1Model Category=Scalar RMs, Model Size=8B2026.03 | 90.4 | |
| CDRRM-8B (Base)Model Category=Ours (CDRRM), Model Size=8B, Training Stage=Base2026.03 | 90.4 | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 90.3 | |
| Internlm2-20b-rewardSize=20b2026.02 | 90.2 | |
| InternLM2-20B-RewardModel=InternLM2-20B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 90.2 | |
| Internlm2-20b-rewardModel Type=ScalarRM, Backbone=InternLM2-20B2026.02 | 90.2 | |
| Internlm2-20b-rewardParadigm=Bradley-Terry2025.07 | 90.2 | |
| Internlm2-20b-rewardReward Model Category=ScalarRMs2025.05 | 90.2 | |
| Self-taught-evaluator-llama3.1-70BReward Model Category=ReasRMs2025.05 | 90.2 | |
| InternLM2-20B-RewardModel Category=Scalar RMs, Model Size=20B2026.03 | 90.2 | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 89.9 | |
| OPRM-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 89.3 | |
| OPRM-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 89.3 | |
| OPRM-RgFT-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 89.1 | |
| Llama-3-OffsetBias-RM-8BSize=8B2026.02 | 89 | |
| Llama-3-OffsetBias-RM-8BModel Type=ScalarRM, Backbone=Llama-3-8B2026.02 | 89 | |
| RM-R1-Qwen-Instruct-32BModel Type=GenRM, Backbone=Qwen-32B2026.02 | 89 | |
| Llama-3-OffsetBias-RM-8BParadigm=Bradley-Terry2025.07 | 89 | |
| OPRM-RgFT-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 88.9 | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-14BReward Model Category=Our Methods2025.05 | 88.9 | |
| SteerLM-RM-70BReward Model Category=ScalarRMs2025.05 | 88.8 | |
| SteerLM-RM-70BModel Category=Scalar RMs, Model Size=70B2026.03 | 88.8 | |
| R3-Qwen3-8BModel Category=Rubric-based RMs, Model Size=8B2026.03 | 88.8 | |
| GRM-gemma2-2B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 88.5 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 88.5 | |
| DeepSeek-GRM-27BBase Model=DeepSeek-27B, GT=True2026.04 | 88.5 | |
| Gemini-1.5-proReward Model Category=GenRMs2025.05 | 88.2 | |
| RM-R1-QWEN-INSTRUCT-14BReward Model Category=Our Methods2025.05 | 88.2 | |
| OPRM-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 87.8 | |
| Internlm2-7b-rewardParadigm=Bradley-Terry2025.07 | 87.6 | |
| Internlm2-7b-rewardReward Model Category=ScalarRMs2025.05 | 87.6 | |
| OPRM-RgFT-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 87.3 | |
| DeepSeek-PairRM-27BModel=DeepSeek-PairRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 87.1 | |
| RM-R1-Qwen-Instruct-14BModel Type=GenRM, Backbone=Qwen-14B2026.02 | 87.1 | |
| DeepSeek-PairRM-27BReward Model Category=ReasRMs2025.05 | 87.1 | |
| DeepSeek-GRM-27BModel=DeepSeek-GRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 86.9 | |
| Gemini-1.5-ProModel=Gemini-1.5-Pro, Source (Reported vs. Reproduced)=Reported2026.02 | 86.8 | |
| GPT-4oModel=GPT-4o, Source (Reported vs. Reproduced)=Reported2026.02 | 86.7 | |
| GPT-4oModel Type=GenRM2026.02 | 86.7 | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 86.7 | |
| GPT-4o-0806Reward Model Category=GenRMs2025.05 | 86.7 |