Reward Modeling on RMB
89.3AccuracySkywork-Reward-V2-Llama-3.1-8B-40M
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 89.3 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 86.4 | |
| DeepSeek-V3.22026.03 | 83.9 | |
| Skywork-Reward-V2Backbone=gemma-2-9b-it2025.07 | 83.9 | |
| FARE-8BStage=SFT, Data=2.5M2026.03 | 83.2 | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 81.2 | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 80.6 | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 80.5 | |
| Mix-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 80.1 | |
| Gemini-3-Flash2026.03 | 79.2 | |
| Base-GRMStage=SFT, Data=9K2026.03 | 79.2 | |
| ConsistRM (Qwen3-8B)GT=False2026.04 | 79.1 | |
| Mix-GRMStage=SFT, Data=9K2026.03 | 78.9 | |
| Qwen3-8B2026.04 | 78.8 | |
| RubricRM-8BStage=SFT, Data=36K2026.03 | 78.5 | |
| Base-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 78.5 | |
| Skywork-Reward-V2Backbone=Qwen2.5-7B2025.07 | 78.3 | |
| Qwen3-8B + RFTGT=True2026.04 | 78.2 | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 78.1 | |
| Qwen3-8B + CAARGT=False2026.04 | 78.1 | |
| Qwen3-4B + CAARGT=False2026.04 | 77.5 | |
| Skywork-Reward-V2Backbone=gemma-3-1b-it2025.07 | 77.1 | |
| Skywork-Reward-V2Backbone=gemma-3-4b2025.07 | 77.1 | |
| Qwen3-8B + SFTGT=True2026.04 | 76.9 | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 76.7 | |
| Skywork-Reward-V2Backbone=gemma-2-2b-it2025.07 | 76.7 | |
| Qwen3-4B + RFTGT=True2026.04 | 76.7 | |
| Qwen3-4B + SFTGT=True2026.04 | 76.5 | |
| ConsistRM (Qwen3-4B)GT=False2026.04 | 76.5 | |
| Qwen3-4B2026.04 | 76.4 | |
| OPRM-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 75.6 | |
| Qwen3-4B + TTRLGT=False2026.04 | 75.6 | |
| OPRM-RgFT-Qwen2.5-32BModel=OPRM, Backbone=Qwen2.5-32B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 74.8 | |
| Skywork-Reward-V2-Qwen3-0.6BParadigm=Our Reward Models2025.07 | 74.5 | |
| Skywork-Reward-8BStage=BT, Data=44K2026.03 | 74.4 | |
| OPRM-RgFT-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 74.2 | |
| Qwen3-8B + TTRLGT=False2026.04 | 74.2 | |
| GPT-4oModel=GPT-4o, Source (Reported vs. Reproduced)=Reported2026.02 | 73.8 | |
| OPRM-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 73.8 | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 73.8 | |
| GPT-4o-0806Reward Model Category=GenRMs2025.05 | 73.8 | |
| OPRM-Qwen2.5-72BModel=OPRM, Backbone=Qwen2.5-72B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 73.5 | |
| JudgeLRM-7BStage=RL, Data=100K2026.03 | 73.1 | |
| RM-R1-Qwen-Instruct-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 73 | |
| RM-R1-QWEN-INSTRUCT-32BReward Model Category=Our Methods2025.05 | 73 | |
| OPRM-RgFT-Qwen2.5-14BModel=OPRM, Backbone=Qwen2.5-14B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 72.8 | |
| Starling-RM-34BParadigm=Bradley-Terry2025.07 | 72 | |
| OPRM-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=false, Source (Reported vs. Reproduced)=Ours2026.02 | 71.5 | |
| DeepSeek-GRM-16BStage=SFT, RL, Data=1.2M, 237K2026.03 | 70.8 | |
| Claude-3.5-sonnetModel=Claude-3.5-sonnet, Source (Reported vs. Reproduced)=Reported2026.02 | 70.6 | |
| Claude-3.5-SonnetParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 70.6 | |
| Claude-3-5-sonnet-20240620Reward Model Category=GenRMs2025.05 | 70.6 | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 70.5 | |
| INF-ORM-Llama3.1-70B2025.07 | 70.5 | |
| INF-ORM-Llama3.1-70BReward Model Category=ScalarRMs2025.05 | 70.5 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models, Integration=w/ MetaRM2025.07 | 70.3 | |
| DeepSeek-GRM-27BGT=True2026.04 | 70.3 | |
| FsfairX-LLaMA3-RM-v0.1Paradigm=Bradley-Terry2025.07 | 70.2 | |
| GRM-Llama3-8B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 70.2 | |
| CIR-AMS/BTRM_Qwen2_7b_06132025.07 | 70.2 | |
| OPRM-RgFT-Qwen2.5-7BModel=OPRM, Backbone=Qwen2.5-7B, Region Flooding Tuning (RgFT)=true, Source (Reported vs. Reproduced)=Ours2026.02 | 70.1 | |
| Nemotron-4-340B-RewardModel=Nemotron-4-340B-Reward, Source (Reported vs. Reproduced)=Reported2026.02 | 69.9 | |
| RM-R1-7B (Instruct)Stage=SFT, RL, Data=9K, 64K2026.03 | 69.9 | |
| Nemotron-4-340B-RewardReward Model Category=ScalarRMs2025.05 | 69.9 | |
| RM-R1-DeepSeek-Distill-Qwen-32BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 69.8 | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-32BReward Model Category=Our Methods2025.05 | 69.8 | |
| Skywork-Reward-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 69.5 | |
| Skywork-Reward-Gemma-2-27B-v0.2Paradigm=Bradley-Terry2025.07 | 69.4 | |
| Skywork-Reward-Llama-3.1-8BReward Model Category=ScalarRMs2025.05 | 69.3 | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 69.2 | |
| RM-R1-QWEN-INSTRUCT-14BReward Model Category=Our Methods2025.05 | 69.2 | |
| DeepSeek-GRM-27BModel=DeepSeek-GRM-27B, Source (Reported vs. Reproduced)=Reproduced2026.02 | 69 | |
| DeepSeek-GRM-27BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 69 | |
| DeepSeek-GRM-27BReward Model Category=ReasRMs2025.05 | 69 | |
| LLaMA-3.1-70b-InstructModel=LLaMA-3.1-70b-Instruct, Source (Reported vs. Reproduced)=Reported2026.02 | 68.9 | |
| Llama3.1-70B-InstructReward Model Category=GenRMs2025.05 | 68.9 | |
| GRM-llama3-8B-distillParadigm=Bradley-Terry2025.07 | 68.8 | |
| RM-R1-DEEPSEEK-DISTILLED-QWEN-14BReward Model Category=Our Methods2025.05 | 68.5 | |
| Eurus-RM-7bReward Model Category=ScalarRMs2025.05 | 68.3 | |
| GRM-gemma2-2B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 68 | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 67.9 | |
| Internlm2-7b-rewardParadigm=Bradley-Terry2025.07 | 67.1 | |
| Internlm2-7b-rewardReward Model Category=ScalarRMs2025.05 | 67.1 | |
| DeepSeek-GRM-27B-RFTModel=DeepSeek-GRM-27B-RFT, Source (Reported vs. Reproduced)=Reproduced2026.02 | 67 | |
| DeepSeek-GRM-27B-RFTReward Model Category=ReasRMs2025.05 | 67 | |
| Self-taught-evaluator-llama3.1-70BReward Model Category=ReasRMs2025.05 | 67 | |
| RM-Mistral-7BParadigm=Bradley-Terry2025.07 | 66.6 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Paradigm=Bradley-Terry2025.07 | 66.6 | |
| RM-R1-QWEN-INSTRUCT-7BReward Model Category=Our Methods2025.05 | 66.4 | |
| DeepSeek-V2.5-0905Model=DeepSeek-V2.5-0905, Source (Reported vs. Reproduced)=Reported2026.02 | 65.7 | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 65.7 | |
| Eurus-RM-7bParadigm=Bradley-Terry2025.07 | 65.5 | |
| Ray2333/GRM-gemma2-2B-rewardmodel-ft2025.07 | 65.5 | |
| Skywork-Critic-Llama-3.1-70BReward Model Category=GenRMs2025.05 | 65.5 | |
| RM-R1-7B (Distill)Stage=SFT, RL, Data=9K, 64K2026.03 | 65.1 | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 64.9 | |
| LLM-as-a-JudgeModel=LLM-as-a-Judge, Source (Reported vs. Reproduced)=Reproduced2026.02 | 64.8 | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 64.7 | |
| ArmoRM-8B-v0.1Model=ArmoRM-8B-v0.1, Source (Reported vs. Reproduced)=Reported2026.02 | 64.6 | |
| ArmoRM-Llama3-8B-v0.1Paradigm=Bradley-Terry2025.07 | 64.6 |