Reward Modeling on RM-Bench
96AccuracySkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 96 | — | — | — | — | |
| Gemini-3-Flash2026.03 | 93.8 | — | — | — | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-235B-A22B-Instruct-25072026.02 | 93 | — | — | — | 89.4 | |
| Skywork-Reward-V2-Llama-3.1-8BModel Category=Open Scalar Reward Model2026.02 | 92.8 | — | — | — | 84.3 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 92.8 | — | — | — | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.22026.02 | 92.7 | — | — | — | 86.7 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.12026.02 | 91.8 | — | — | — | 86.2 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=gpt-oss-120b2026.02 | 91.7 | — | — | — | 86.8 | |
| DeepSeek-V3.22026.03 | 91.4 | — | — | — | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-30B-A3B-Instruct-25072026.02 | 91.1 | — | — | — | 84.9 | |
| RationaleRMModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric, Base Model=Qwen3-30B-A3B2026.02 | 87.1 | — | — | — | — | |
| CAMEL-ReflectionModel Type=GenRM, Method Variant=+ Reflection2026.02 | 84.2 | — | — | — | — | |
| RM-R1-DeepSeek-Distill-Qwen-32BModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric2026.02 | 83.9 | — | — | — | — | |
| RM-R1-DeepSeek-Distill-Qwen-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 83.9 | — | — | — | — | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-32BReward Model Category=Our Methods2025.05 | 83.9 | — | — | — | — | |
| J1-Llama-70BModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric2026.02 | 82.7 | — | — | — | — | |
| J1-Llama-70BModel Type=GenRM2026.02 | 82.7 | — | — | — | — | |
| Mix-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 82.7 | — | — | — | — | |
| J1-Llama-70BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 82.7 | — | — | — | — | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 82.6 | — | — | — | — | |
| SAVEPolicy Model=Qwen3-4B-Instruct-25072026.05 | 82.3 | — | — | — | — | |
| EvalPlannerModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric, Base Model=Llama-3.3-70B2026.02 | 82.1 | — | — | — | — | |
| EvalPlannerParadigm=LLM-as-a-Judge & Generative Reward Models, Backbone=Llama-3.3-70B2025.07 | 82.1 | — | — | — | — | |
| SAVEPolicy Model=Qwen2.5-3B-Instruct2026.05 | 82.1 | — | — | — | — | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen3-4B-Instruct-25072026.05 | 82 | — | — | — | — | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen3-4B-Instruct-25072026.05 | 82 | — | — | — | — | |
| CAMELModel Type=GenRM2026.02 | 81.9 | — | — | — | — | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen2.5-3B-Instruct2026.05 | 81.9 | — | — | — | — | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen2.5-3B-Instruct2026.05 | 81.7 | — | — | — | — | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 81.6 | — | — | — | — | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-14BReward Model Category=Our Methods2025.05 | 81.5 | — | — | — | — | |
| HL-BTPolicy Model=Qwen3-4B-Instruct-25072026.05 | 81.4 | — | — | — | — | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 81.1 | — | — | — | — | |
| HL-BTPolicy Model=Qwen2.5-3B-Instruct2026.05 | 81 | — | — | — | — | |
| Continual Offline Training RM2026.05 | 80.6 | — | — | — | — | |
| EvalPlannerParadigm=LLM-as-a-Judge & Generative Reward Models, Backbone=Llama-3.1-70B2025.07 | 80 | — | — | — | — | |
| Skywork-Reward-V2-Llama-3.2-3B2026.05 | 80 | — | — | — | — | |
| Mix-GRMStage=SFT, Data=9K2026.03 | 79.2 | — | — | — | — | |
| RM-R1-Qwen-Instruct-32BModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric2026.02 | 79.1 | — | — | — | — | |
| RM-R1-Qwen-Instruct-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 79.1 | — | — | — | — | |
| RM-R1-QWEN-INSTRUCT-32BReward Model Category=Our Methods2025.05 | 79.1 | — | — | — | — | |
| Base-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 78.8 | — | — | — | — | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 78.7 | — | — | — | — | |
| JudgeLRM-7BStage=RL, Data=100K2026.03 | 78.5 | — | — | — | — | |
| ConsistRM (Qwen3-8B)GT=False2026.04 | 78.3 | — | — | — | — | |
| Qwen3-8B + RFTGT=True2026.04 | 78.2 | — | — | — | — | |
| Qwen3-8B + TTRLGT=False2026.04 | 77.4 | — | — | — | — | |
| Qwen3-8B + CAARGT=False2026.04 | 77.3 | — | — | — | — | |
| Qwen3-8B + SFTGT=True2026.04 | 77.1 | — | — | — | — | |
| Base-GRMStage=SFT, Data=9K2026.03 | 77 | — | — | — | — | |
| ConsistRM (Qwen3-4B)GT=False2026.04 | 76.8 | — | — | — | — | |
| RM-R1-7B (Distill)Stage=SFT, RL, Data=9K, 64K2026.03 | 76.6 | — | — | — | — | |
| Qwen3-4B + RFTGT=True2026.04 | 76.6 | — | — | — | — | |
| Qwen3-4B + CAARGT=False2026.04 | 76.6 | — | — | — | — | |
| Mean RewardPolicy Model=Qwen2.5-3B-Instruct2026.05 | 76.6 | — | — | — | — | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 76.3 | — | — | — | — | |
| Qwen3-4B + TTRLGT=False2026.04 | 76.3 | — | — | — | — | |
| RM-R1-QWEN-INSTRUCT-14BReward Model Category=Our Methods2025.05 | 76.1 | — | — | — | — | |
| Qwen3-4B + SFTGT=True2026.04 | 76.1 | — | — | — | — | |
| Qwen3-8B2026.04 | 75.8 | — | — | — | — | |
| Mean RewardPolicy Model=Qwen3-4B-Instruct-25072026.05 | 75.8 | — | — | — | — | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 75.4 | — | — | — | — | |
| Gemini-1.5-proReward Model Category=GenRMs2025.05 | 75.2 | — | — | — | — | |
| RM-R1-7B (Instruct)Stage=SFT, RL, Data=9K, 64K2026.03 | 75.1 | — | — | — | — | |
| CAMEL-FastModel Type=GenRM2026.02 | 74.8 | — | — | — | — | |
| Claude-3.5-SonnetParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 74.5 | — | — | — | — | |
| Qwen3-4B2026.04 | 74.5 | — | — | — | — | |
| Skywork-Reward-V2-Qwen3-0.6BParadigm=Our Reward Models2025.07 | 74.4 | — | — | — | — | |
| FARE-8BStage=SFT, Data=2.5M2026.03 | 74.1 | — | — | — | — | |
| RubricRM-8BStage=SFT, Data=36K2026.03 | 74 | — | — | — | — | |
| INF-ORM-Llama3.1-70BModel Category=Open Scalar Reward Model2026.02 | 73.8 | — | — | — | 71.7 | |
| INF-ORM-Llama3.1-70BModel Type=ScalarRM2026.02 | 73.8 | — | — | — | — | |
| J1-Llama-8BModel Type=GenRM2026.02 | 73.4 | — | — | — | — | |
| J1-Llama-8BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 73.4 | — | — | — | — | |
| J1-Llama-8BGT=True2026.04 | 73.4 | — | — | — | — | |
| RM-R1-Qwen-Instruct-32BModel Type=GenRM2026.02 | 73.1 | — | — | — | — | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 73.1 | — | — | — | — | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 72.8 | — | — | — | — | |
| GPT-4oModel Type=GenRM2026.02 | 72.5 | — | — | — | — | |
| RM-R1-Qwen-Instruct-14BModel Type=GenRM2026.02 | 72.5 | — | — | — | — | |
| QRM-Llama3.1-8B-v2Paradigm=Bradley-Terry2025.07 | 72.5 | — | — | — | — | |
| GPT-4o-0806Reward Model Category=GenRMs2025.05 | 72.5 | — | — | — | — | |
| Skywork-Reward-8BStage=BT, Data=44K2026.03 | 72.4 | — | — | — | — | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-7BReward Model Category=Our Methods2025.05 | 72.4 | — | — | — | — | |
| Llama-3.1-Nemotron-70BModel Category=Open Scalar Reward Model2026.02 | 72.2 | — | — | — | 70.5 | |
| Llama-3.1-Nemotron-70BModel Type=ScalarRM2026.02 | 72.2 | — | — | — | — | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 72.2 | — | — | — | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Category=Open Scalar Reward Model2026.02 | 72.1 | — | — | — | 67.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=ScalarRM2026.02 | 72.1 | — | — | — | — | |
| Internlm2-20b-rewardParadigm=Bradley-Terry2025.07 | 72.1 | — | — | — | — | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 72 | — | — | — | — | |
| Skywork-Critic-Llama-3.1-70BReward Model Category=GenRMs2025.05 | 71.9 | — | — | — | — | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 71.8 | — | — | — | — | |
| Self-taught-evaluator-llama3.1-70BReward Model Category=ReasRMs2025.05 | 71.4 | — | — | — | — | |
| Llama-3-OffsetBias-RM-8BModel Category=Open Scalar Reward Model2026.02 | 71.3 | — | — | — | 65 | |
| Llama-3-OffsetBias-RM-8BModel Type=ScalarRM2026.02 | 71.3 | — | — | — | — | |
| Llama-3-OffsetBias-RM-8BParadigm=Bradley-Terry2025.07 | 71.3 | — | — | — | — | |
| LDL-Reward-Gemma-2-27B-v0.1Model Category=Open Scalar Reward Model2026.02 | 71.1 | — | — | — | 67.4 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=ScalarRM2026.02 | 71.1 | — | — | — | — | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 71 | — | — | — | — |