Reward Modeling on JudgeBench
93.3AccuracyOpenRS
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=gpt-oss-120b2026.02 | 93.3 | 86.8 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-235B-A22B-Instruct-25072026.02 | 91.6 | 89.4 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.22026.02 | 89.4 | 86.7 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=DeepSeek-V3.12026.02 | 89.1 | 86.2 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Base Model=Qwen3-30B-A3B-Instruct-25072026.02 | 86.4 | 84.9 | |
| Skywork-Reward-V2-Llama-3.1-8B-40MParadigm=Our Reward Models2025.07 | 83.4 | — | |
| RationaleRMModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric, Base Model=Qwen3-30B-A3B2026.02 | 82 | — | |
| Skywork-Reward-V2-Llama-3.1-8BModel Category=Open Scalar Reward Model2026.02 | 80 | 84.3 | |
| Skywork-Reward-V2-Llama-3.1-8BParadigm=Our Reward Models2025.07 | 80 | — | |
| Skywork-Reward-V2Backbone=gemma-2-9b-it2025.07 | 77.9 | — | |
| Skywork-Reward-V2Backbone=gemma-3-4b2025.07 | 76 | — | |
| Auto-RubricModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric, Re-implementation=true2026.02 | 74.3 | — | |
| Skywork-Reward-V2Backbone=gemma-3-1b-it2025.07 | 73.5 | — | |
| Skywork-Reward-V2-Qwen3-8BParadigm=Our Reward Models2025.07 | 73.4 | — | |
| Skywork-Reward-V2-Qwen3-1.7BParadigm=Our Reward Models2025.07 | 72.9 | — | |
| CAMEL-ReflectionModel Type=GenRM, Method Variant=+ Reflection2026.02 | 71.6 | — | |
| SAVEPolicy Model=Qwen3-4B-Instruct-25072026.05 | 71.4 | — | |
| Skywork-Reward-V2Backbone=Qwen2.5-7B2025.07 | 71.1 | — | |
| INF-ORM-Llama3.1-70BBackbone=Llama3.1-70B2026.02 | 70.2 | — | |
| INF-ORM-Llama3.1-70BModel Category=Open Scalar Reward Model2026.02 | 70.2 | 71.7 | |
| INF-ORM-Llama3.1-70BModel Type=ScalarRM2026.02 | 70.2 | — | |
| INF-ORM-Llama3.1-70BParadigm=Bradley-Terry2025.07 | 70.2 | — | |
| INF-ORM-Llama3.1-70B2025.07 | 70.2 | — | |
| Athene-RM-8BSize=8B2026.02 | 70.1 | — | |
| Skywork-Reward-V2Backbone=gemma-2-2b-it2025.07 | 70 | — | |
| Continual Offline Training RM2026.05 | 70 | — | |
| SAVEPolicy Model=Qwen2.5-3B-Instruct2026.05 | 70 | — | |
| Skywork-Reward-V2-Qwen3-4BParadigm=Our Reward Models2025.07 | 69.5 | — | |
| Ray2333/GRM-gemma2-2B-rewardmodel-ft2025.07 | 69.4 | — | |
| Skywork-Reward-V2-Llama-3.2-3BParadigm=Our Reward Models2025.07 | 69.2 | — | |
| Skywork-Reward-V2-Llama-3.2-3B2026.05 | 69.2 | — | |
| CAMELModel Type=GenRM2026.02 | 69.1 | — | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen2.5-3B-Instruct2026.05 | 69.1 | — | |
| SAVE (w/o Curriculum Mechanism)Policy Model=Qwen3-4B-Instruct-25072026.05 | 68.9 | — | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen2.5-3B-Instruct2026.05 | 68.3 | — | |
| SAVE (w/o Policy Model Optimization)Policy Model=Qwen3-4B-Instruct-25072026.05 | 68.3 | — | |
| HL-BTPolicy Model=Qwen2.5-3B-Instruct2026.05 | 67.7 | — | |
| HL-BTPolicy Model=Qwen3-4B-Instruct-25072026.05 | 67.7 | — | |
| Skywork-Reward-V2-Qwen3-0.6BParadigm=Our Reward Models2025.07 | 67.6 | — | |
| Skywork-Reward-Gemma-2-27B-v0.2Backbone=Gemma-2-27B2026.02 | 66.5 | — | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Category=Open Scalar Reward Model2026.02 | 66.5 | 67.3 | |
| Skywork-Reward-Gemma-2-27B-v0.2Model Type=ScalarRM2026.02 | 66.5 | — | |
| Skywork-Reward-Gemma-2-27B-v0.2Paradigm=Bradley-Terry2025.07 | 66.5 | — | |
| WILDREWARD-8BSize=8B2026.02 | 66 | — | |
| Llama-3.1-Nemotron-70BSize=70B2026.02 | 65.8 | — | |
| Llama-3.1-Nemotron-70BModel Category=Open Scalar Reward Model2026.02 | 65.8 | 70.5 | |
| Llama-3.1-Nemotron-70BModel Type=ScalarRM2026.02 | 65.8 | — | |
| Llama-3.1-Nemotron-70BParadigm=Bradley-Terry2025.07 | 65.8 | — | |
| CAMEL-FastModel Type=GenRM2026.02 | 65.2 | — | |
| Skywork-Reward-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 65.2 | — | |
| Skywork-Reward-V2-Llama-3.2-1BParadigm=Our Reward Models2025.07 | 65 | — | |
| Claude-3.5-SonnetModel Type=GenRM2026.02 | 64.8 | — | |
| RM-R1-Qwen-Instruct-32BModel Type=GenRM2026.02 | 64.8 | — | |
| Claude-3.5-SonnetParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 64.8 | — | |
| CIR-AMS/BTRM_Qwen2_7b_06132025.07 | 64.5 | — | |
| Internlm2-20b-rewardSize=20b2026.02 | 64.3 | — | |
| Internlm2-20b-rewardModel Category=Open Scalar Reward Model2026.02 | 64.3 | 64.8 | |
| Internlm2-20b-rewardModel Type=ScalarRM2026.02 | 64.3 | — | |
| Internlm2-20b-rewardParadigm=Bradley-Terry2025.07 | 64.3 | — | |
| LDL-Reward-Gemma-2-27B-v0.1Model Category=Open Scalar Reward Model2026.02 | 64.2 | 67.4 | |
| LDL-Reward-Gemma-2-27B-v0.1Model Type=ScalarRM2026.02 | 64.2 | — | |
| LDL-Reward-Gemma-2-27B-v0.1Paradigm=Bradley-Terry2025.07 | 64.2 | — | |
| URM-LLaMa-3.1-8BParadigm=Bradley-Terry2025.07 | 64.1 | — | |
| BTRM Qwen2 7b 0613Paradigm=Bradley-Terry2025.07 | 63.8 | — | |
| QRM-Llama3.1-8BParadigm=Bradley-Terry2025.07 | 63.8 | — | |
| Starling-RM-34BParadigm=Bradley-Terry2025.07 | 63.8 | — | |
| Llama-3-OffsetBias-RM-8BSize=8B2026.02 | 63.5 | — | |
| Llama-3-OffsetBias-RM-8BModel Category=Open Scalar Reward Model2026.02 | 63.5 | 65 | |
| Llama-3-OffsetBias-RM-8BModel Type=ScalarRM2026.02 | 63.5 | — | |
| GRM-gemma2-2B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 63.5 | — | |
| Llama-3-OffsetBias-RM-8BParadigm=Bradley-Terry2025.07 | 63.5 | — | |
| GRM-llama3-8B-distillParadigm=Bradley-Terry2025.07 | 63.3 | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Backbone=Llama-3.1-8B2026.02 | 62.9 | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Category=Open Scalar Reward Model2026.02 | 62.9 | 67.1 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Type=ScalarRM2026.02 | 62.9 | — | |
| Skywork-Reward-Llama-3.1-8B-v0.2Paradigm=Bradley-Terry2025.07 | 62.9 | — | |
| QRM-Llama3.1-8B-v2Paradigm=Bradley-Terry2025.07 | 62.6 | — | |
| GRM-Llama3-8B-rewardmodel-ftParadigm=Bradley-Terry2025.07 | 62.3 | — | |
| RM-Mistral-7BParadigm=Bradley-Terry2025.07 | 62.1 | — | |
| Skywork-Reward-Llama-3.1-8BParadigm=Bradley-Terry2025.07 | 62 | — | |
| RM-R1-Qwen-Instruct-14BModel Type=GenRM2026.02 | 61.3 | — | |
| WILDREWARD-4BSize=4B2026.02 | 61.1 | — | |
| Mean RewardPolicy Model=Qwen2.5-3B-Instruct2026.05 | 60.9 | — | |
| Mean RewardPolicy Model=Qwen3-4B-Instruct-25072026.05 | 60.9 | — | |
| J1-Llama-70BModel Category=LLM-as-a-Judge & Generative Reward Models & Rubric2026.02 | 60 | — | |
| J1-Llama-70BModel Type=GenRM2026.02 | 60 | — | |
| J1-Llama-70BParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 60 | — | |
| FsfairX-LLaMA3-RM-v0.1Paradigm=Bradley-Terry2025.07 | 59.9 | — | |
| GPT-4oModel Type=GenRM2026.02 | 59.8 | — | |
| GPT-4oParadigm=LLM-as-a-Judge & Generative Reward Models2025.07 | 59.8 | — | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama3-8B2026.02 | 59.7 | — | |
| ArmoRM-Llama3-8B-v0.1Model Category=Open Scalar Reward Model2026.02 | 59.7 | 63.4 | |
| ArmoRM-Llama3-8B-v0.1Model Type=ScalarRM2026.02 | 59.7 | — | |
| ArmoRM-Llama3-8B-v0.1Paradigm=Bradley-Terry2025.07 | 59.7 | — | |
| Internlm2-7b-rewardParadigm=Bradley-Terry2025.07 | 59.4 | — | |
| internlm2-1.8b-rewardParadigm=Bradley-Terry2025.07 | 59 | — | |
| Eurus-RM-7bParadigm=Bradley-Terry2025.07 | 58.4 | — | |
| QRM-Gemma-2-27BParadigm=Bradley-Terry2025.07 | 57.5 | — | |
| ConsistRM (Qwen3-8B)GT=False2026.04 | 56.9 | — | |
| Qwen3-8B + TTRLGT=False2026.04 | 56.8 | — |