Reward Modeling on RewardBench v2
92.1AccuracyDeepSeek-V3.2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DeepSeek-V3.22026.03 | 92.1 | — | |
| Gemini-3-Flash2026.03 | 91.1 | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-235B-A22B-Instruct-25072026.02 | 90.7 | 89.4 | |
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 86.5 | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.22026.02 | 85.8 | 86.7 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=gpt-oss-120b2026.02 | 85.7 | 86.8 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.12026.02 | 85.6 | 86.2 | |
| Skywork-Reward-V2-Llama-3.1-8BModel Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 84.1 | 84.3 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 84.1 | — | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-30B-A3B-Instruct-25072026.02 | 83.7 | 84.9 | |
| Skywork-Reward-8BStage=BT, Data=44K2026.03 | 79.7 | — | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 78.2 | — | |
| Mix-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 77.5 | — | |
| Llama-3.1-Nemotron-70BModel Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 76.7 | 70.5 | |
| QRM-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 76.7 | — | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 76.7 | — | |
| INF-ORM-Llama3.1-70BModel Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 76.5 | 71.7 | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 76.5 | — | |
| Skywork-Reward-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 75.8 | — | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 75.5 | — | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 75.3 | 67.3 | |
| Skywork-Reward-Gemma-2-27B-v0.2Paradigm=Bradley-Terry2025.07 | 75.3 | — | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 74.7 | — | |
| Base-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 74 | — | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 73.9 | — | |
| FARE-8BStage=SFT, Data=2.5M2026.03 | 73.4 | — | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 73.1 | — | |
| LDL-Reward-Gemma-2-27B-v0.1Model Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 72.5 | 67.4 | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 72.5 | — | |
| RubricRM-8BStage=SFT, Data=36K2026.03 | 71.9 | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 71.8 | 67.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Paradigm=Bradley-Terry2025.07 | 71.8 | — | |
| QRM-Llama3.1-8B-v2Paradigm=Bradley-Terry2025.07 | 70.7 | — | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 70.7 | — | |
| Skywork/Skywork-VL-Reward-7BParams (B)=7.0, Type=Seq. Classifier2026.02 | 68.847 | — | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 68.3 | — | |
| Mix-GRMStage=SFT, Data=9K2026.03 | 67.8 | — | |
| GRM-Llama3-8B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 67.7 | — | |
| ArmoRM-Llama3-8B-v0.1Model Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 66.5 | 63.4 | |
| ArmoRM-Llama3-8B-v0.1Paradigm=Bradley-Terry2025.07 | 66.5 | — | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 64.9 | — | |
| Llama-3-OffsetBias-RM-8BModel Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 64.8 | 65 | |
| Llama-3-OffsetBias-RM-8BParadigm=Bradley-Terry2025.07 | 64.8 | — | |
| Base-GRMStage=SFT, Data=9K2026.03 | 64.7 | — | |
| Claude-3.5-SonnetParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 64.7 | — | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 64.3 | — | |
| FsfairX-LLaMA3-RM-v0.1Paradigm=Bradley-Terry2025.07 | 62.9 | — | |
| RM-R1-7B (Instruct)Stage=SFT, RL, Data=9K, 64K2026.03 | 61.4 | — | |
| Skywork-Reward-V2-Qwen3-0.6BParadigm=Our Reward Models2025.07 | 61.3 | — | |
| GRM-gemma2-2B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 59.7 | — | |
| weqweasdas/RM-Mistral-7BParams (B)=7.0, Type=Seq. Classifier2026.02 | 59.601 | — | |
| RM-Mistral-7BParadigm=Bradley-Terry2025.07 | 59.6 | — | |
| GRM-llama3-8B-distillParadigm=Bradley-Terry2025.07 | 58.9 | — | |
| Eurus-RM-7bParadigm=Bradley-Terry2025.07 | 58.1 | — | |
| openbmb/Eurus-RM-7bParams (B)=7.0, Type=Seq. Classifier2026.02 | 58.057 | — | |
| BTRM Qwen2 7b 0613Paradigm=Bradley-Terry2025.07 | 57.4 | — | |
| CIR-AMS/BTRM_Qwen2_7b_0613Params (B)=7.0, Type=Seq. Classifier2026.02 | 57.363 | — | |
| Finemath-RM-Qwen-2.5-7BParams (B)=7.0, Type=Seq. Classifier2026.02 | 57 | — | |
| Internlm2-20b-rewardModel Category=Open Scalar Reward Model, Re-implementation=false2026.02 | 56.3 | 64.8 | |
| Internlm2-20b-rewardParadigm=Bradley-Terry2025.07 | 56.3 | — | |
| DeepSeek-GRM-16BStage=SFT, RL, Data=1.2M, 237K2026.03 | 56 | — | |
| JudgeLRM-7BStage=RL, Data=100K2026.03 | 55.6 | — | |
| Internlm2-7b-rewardParadigm=Bradley-Terry2025.07 | 53.4 | — | |
| internlm/internlm2-7b-rewardParams (B)=7.0, Type=Seq. Classifier2026.02 | 53.348 | — | |
| RM-R1-7B (Distill)Stage=SFT, RL, Data=9K, 64K2026.03 | 48.7 | — | |
| weqweasdas/RM-Gemma-7BParams (B)=7.0, Type=Seq. Classifier2026.02 | 48.255 | — | |
| Starling-RM-34BParadigm=Bradley-Terry2025.07 | 45.5 | — | |
| internlm2-1.8b-rewardParadigm=Bradley-Terry2025.07 | 39 | — | |
| PKU-Alignment/beaver-7b-v1.0-costParams (B)=7.0, Type=Seq. Classifier2026.02 | 33.322 | — | |
| PKU-Alignment/beaver-7b-v2.0-costParams (B)=7.0, Type=Seq. Classifier2026.02 | 33.261 | — | |
| PKU-Alignment/beaver-7b-v2.0-rewardParams (B)=7.0, Type=Seq. Classifier2026.02 | 25.435 | — | |
| PKU-Alignment/beaver-7b-v1.0-rewardParams (B)=7.0, Type=Seq. Classifier2026.02 | 16.057 | — | |
| Finemath-RM-Llama-3.2-3BParams (B)=3.0, Type=Seq. Classifier2026.02 | — | 36.2 | |
| Finemath-RM-Qwen-2.5-3BParams (B)=3.0, Type=Seq. Classifier2026.02 | — | 46.2 | |
| OpenAssistant/oasst-rm-2.1-pythia-1.4b-epoch-2.5Params (B)=1.4, Type=Seq. Classifier2026.02 | — | 26.479 | |
| Ray2333/GRM-gemma2-2B-rewardmodel-ftParams (B)=2.0, Type=Seq. Classifier2026.02 | — | 59.661 | |
| Schrieffer/Llama-SARM-4BParams (B)=4.0, Type=Seq. Classifier2026.02 | — | 73.793 | |
| Skywork/Skywork-Reward-V2-Llama-3.2-1BParams (B)=1.0, Type=Seq. Classifier2026.02 | — | 64.376 | |
| Skywork/Skywork-Reward-V2-Llama-3.2-3BParams (B)=3.0, Type=Seq. Classifier2026.02 | — | 74.665 | |
| Skywork/Skywork-Reward-V2-Qwen3-0.6BParams (B)=0.6, Type=Seq. Classifier2026.02 | — | 61.25 | |
| Skywork/Skywork-Reward-V2-Qwen3-1.7BParams (B)=1.7, Type=Seq. Classifier2026.02 | — | 68.176 | |
| Skywork/Skywork-Reward-V2-Qwen3-4BParams (B)=4.0, Type=Seq. Classifier2026.02 | — | 75.51 | |
| weqweasdas/hh_rlhf_rm_open_llama_3bParams (B)=3.0, Type=Seq. Classifier2026.02 | — | 24.98 | |
| weqweasdas/RM-Gemma-2BParams (B)=2.0, Type=Seq. Classifier2026.02 | — | 30.566 |