Reward Modeling on RewardBench 2 (Factuality, Math, Safety, Focus, Ties)
89.89Precise IF ScoreRubric-ARM-8B + Eval-Skill
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Rubric-ARM-8B + Eval-SkillJudge Backbone=Qwen3-8B and Variants, Rubric Model=w/o2026.06 | 89.89 | 75.35 | 65.69 | 67.47 | 94.67 | 90.04 | — | |
| SVR2026.06 | 81.9 | — | 80.6 | 85.3 | 72.4 | 87.5 | — | |
| Eval-Skill (workflow-only)Judge Backbone=Qwen2.5-32B-Instruct2026.06 | 78.33 | 86.25 | 80.71 | 88.76 | 94.1 | 89.37 | — | |
| Eval-Skill (full)Judge Backbone=Qwen2.5-32B-Instruct2026.06 | 78.33 | 84.68 | 77.24 | 85.94 | 95.71 | 86.16 | — | |
| Eval-Skill (adaptive)Judge Backbone=Qwen2.5-32B-Instruct2026.06 | 78.33 | 85.37 | 80.71 | 85.94 | 95.71 | 86.16 | — | |
| DSV4 + Eval-SkillJudge Backbone=DeepSeek-V4-Flash, Rubric Model=w/o2026.06 | 76.11 | 86.78 | 84.36 | 84.74 | 96.38 | 92.32 | — | |
| DSV4 + Naive SkillJudge Backbone=DeepSeek-V4-Flash, Rubric Model=w/o2026.06 | 73.89 | 84.91 | 80.71 | 83.53 | 95.43 | 90.97 | — | |
| Qwen3.5-35B-A3B w/ Hybrid RewardModel Category=Our Instantiations, Hybrid Reward Strategy=Hybrid Reward2026.05 | 71 | 85.1 | 79.5 | 88.1 | 92.2 | 82.7 | 97.3 | |
| Self-Rubrics OSSbaseline=self-generated rubrics, model=OSS2026.06 | 70.2 | — | 73.2 | 85.4 | 84.4 | 80.4 | — | |
| OSS2026.06 | 67.5 | — | 76.6 | 85.9 | 83.3 | 89.3 | — | |
| Skywork-RM-v2-8B*Model Category=Trained Reward Models2026.05 | 66.2 | 84.1 | 84.6 | 77.6 | 96.7 | 98.4 | 81.2 | |
| Skywork2026.06 | 64.1 | — | 84.5 | 77.6 | 96.7 | 98.4 | — | |
| DirectJudge Backbone=Qwen2.5-32B-Instruct2026.06 | 63.33 | 77.24 | 75.29 | 85.14 | 77.14 | 85.32 | — | |
| Eval-Skill (full)Judge Backbone=Gemma-2-9B-IT2026.06 | 62.22 | 75.82 | 60.53 | 83.13 | 88.48 | 84.73 | — | |
| Eval-Skill (adaptive)Judge Backbone=Gemma-2-9B-IT2026.06 | 62.22 | 75.82 | 60.53 | 83.13 | 88.48 | 84.73 | — | |
| Gemini-2.5-pro*Model Category=Proprietary LLM Judges2026.05 | 61.9 | 79.5 | 75.5 | 89.8 | 88.1 | 80.5 | 81.1 | |
| Qwen3.5-35B-A3BModel Category=Our Instantiations, Hybrid Reward Strategy=Baseline2026.05 | 61.8 | 80 | 76.8 | 84.4 | 90.5 | 77.7 | 88.6 | |
| Gemini-2.5-FlashModel Category=Black-box LLMs2026.05 | 57.5 | — | — | — | — | 84.1 | — | |
| Gemini-2.5-flash*Model Category=Proprietary LLM Judges2026.05 | 57.5 | 77.7 | 67.4 | 85.2 | 90.9 | 84.1 | 80.9 | |
| Rubric-ARM-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=Rubric-ARM-8B2026.06 | 57.33 | 60.79 | 51.79 | 63.13 | 42.69 | 89.01 | — | |
| DSV4Judge Backbone=DeepSeek-V4-Flash, Rubric Model=DSV42026.06 | 56.67 | 68.69 | 64.98 | 73.49 | 60.86 | 87.43 | — | |
| LMUnit-Qwen2.5-72B*Model Category=Trained Reward Models2026.05 | 54.4 | 82.1 | 87.2 | 72.7 | 91.3 | 96.8 | 90.1 | |
| Qwen3-30B-A3B w/ Hybrid RewardModel Category=Our Instantiations, Hybrid Reward Strategy=Hybrid Reward2026.05 | 53.8 | 78.1 | 67.7 | 84.7 | 90.4 | 82.8 | 89.1 | |
| Rubric-ARM2026.06 | 53.1 | — | 61.7 | 72.7 | 40 | 89.9 | — | |
| Eval-Skill (workflow-only)Judge Backbone=Qwen2-72B-Instruct2026.06 | 49.44 | 75.72 | 69.07 | 82.33 | 93.05 | 84.73 | — | |
| Eval-Skill (full)Judge Backbone=Qwen2-72B-Instruct2026.06 | 47.22 | 76.24 | 67.38 | 84.74 | 94.86 | 87 | — | |
| Eval-Skill (adaptive)Judge Backbone=Qwen2-72B-Instruct2026.06 | 47.22 | 76.58 | 69.07 | 84.74 | 94.86 | 87 | — | |
| DirectJudge Backbone=Qwen2-72B-Instruct2026.06 | 46.67 | 67.58 | 57.6 | 85.14 | 65.62 | 82.87 | — | |
| Rubric-ARROW-voting@5Voting Strategy=voting@52026.05 | 45 | — | — | — | — | 84.9 | — | |
| DSV4Judge Backbone=DeepSeek-V4-Flash, Rubric Model=w/o2026.06 | 45 | 68.27 | 69.07 | 70.68 | 68 | 88.61 | — | |
| Rubric-RM-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=Rubric-RM-8B2026.06 | 43.89 | 54.37 | 43.9 | 61.85 | 37.24 | 84.98 | — | |
| Rubric-ARROW w/o RL-voting@5Voting Strategy=voting@5, Training Protocol=w/o RL2026.05 | 43.1 | — | — | — | — | 77 | — | |
| Rubric-ARROWModel Category=Rubric-based Methods2026.05 | 42.9 | — | — | — | — | 80.8 | — | |
| Q3-8B + Eval-SkillJudge Backbone=Qwen3-8B and Variants, Rubric Model=w/o2026.06 | 42.78 | 70.48 | 64.27 | 71.49 | 93.33 | 80.51 | — | |
| API Prompting (Rubric+Judge pairwise)Evaluation Protocol=Rubric+Judge pairwise2026.05 | 42.5 | — | — | — | — | 79.6 | — | |
| RIFLModel Category=Rubric-based Methods2026.05 | 42.3 | — | — | — | — | 76.7 | — | |
| DirectJudge Backbone=Gemma-2-9B-IT2026.06 | 42.22 | 59.25 | 47.73 | 68.67 | 58.48 | 79.16 | — | |
| RIFL-voting@5Voting Strategy=voting@52026.05 | 41.9 | — | — | — | — | 77.2 | — | |
| Rubric-RM-4BJudge Backbone=Qwen3-4B and Variants, Rubric Model=Rubric-RM-4B2026.06 | 41.67 | 51.33 | 45.33 | 56.63 | 34.29 | 78.73 | — | |
| Qwen3-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=DSV42026.06 | 41.11 | 57.01 | 50.49 | 62.65 | 53.43 | 77.38 | — | |
| Q3-4B + Eval-SkillJudge Backbone=Qwen3-4B and Variants, Rubric Model=w/o2026.06 | 40.56 | 67.55 | 59.02 | 62.25 | 90.86 | 85.06 | — | |
| Rubric-ARROW w/o RLTraining Protocol=w/o RL2026.05 | 40.3 | — | — | — | — | 73.3 | — | |
| Rubric-RM-voting@5Voting Strategy=voting@52026.05 | 40 | — | — | — | — | 86.5 | — | |
| GPT-4.1*Model Category=Proprietary LLM Judges2026.05 | 39.7 | 72.3 | 82.9 | 65.2 | 87.3 | 73.4 | 85.4 | |
| Qwen3-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=Rubric-ARM-8B2026.06 | 39.44 | 51.57 | 47.73 | 51.81 | 41.14 | 77.72 | — | |
| Claude-3.5-SonnetModel Category=Black-box LLMs2026.05 | 38.8 | — | — | — | — | 87 | — | |
| Q3-4B + Naive SkillJudge Backbone=Qwen3-4B and Variants, Rubric Model=w/o2026.06 | 38.33 | 62.31 | 57.96 | 59.44 | 83.43 | 72.41 | — | |
| Qwen3-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=Rubric-RM-8B2026.06 | 37.78 | 51.32 | 43.12 | 56.63 | 42.38 | 76.71 | — | |
| Eval-Skill (workflow-only)Judge Backbone=Gemma-2-9B-IT2026.06 | 37.78 | 68.6 | 57.78 | 82.33 | 80.95 | 84.14 | — | |
| RM-R1-32B (DeepSeek-Dist)Backbone=DeepSeek-Dist2026.05 | 36.9 | — | — | — | — | 79.2 | — | |
| RM-R1-Qwen2.5-7BJudge Backbone=Other Post-Trained RMs, Rubric Model=w/o2026.06 | 36.67 | 47.25 | 39.82 | 44.58 | 44.38 | 70.8 | — | |
| RRM-32BJudge Backbone=Other Post-Trained RMs, Rubric Model=w/o2026.06 | 35 | 60.23 | 55.38 | 76.71 | 55.14 | 78.9 | — | |
| Qwen3-4BJudge Backbone=Qwen3-4B and Variants, Rubric Model=DSV42026.06 | 34.44 | 54.44 | 45.78 | 63.86 | 51.33 | 76.79 | — | |
| RRM-32BModel Category=Larger White-box LLMs2026.05 | 34.4 | — | — | — | — | 83.6 | — | |
| Rubric-RMModel Category=Rubric-based Methods2026.05 | 34.4 | — | — | — | — | 82.2 | — | |
| Qwen3-30B-A3BModel Category=Our Instantiations, Hybrid Reward Strategy=Baseline2026.05 | 34.4 | 66.3 | 61.5 | 70.9 | 84.8 | 74.8 | 71.5 | |
| Q3-8B + Naive SkillJudge Backbone=Qwen3-8B and Variants, Rubric Model=w/o2026.06 | 33.33 | 62.92 | 54.22 | 63.05 | 90.67 | 73.33 | — | |
| RM-R1-32B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst2026.05 | 33.1 | — | — | — | — | 84.2 | — | |
| UAPOModel=Llama-3-8B-Instruct2025.09 | 33 | 33 | 26.9 | 39.4 | 49.9 | 29.3 | 19.4 | |
| Eval-Skill (workflow-only)Judge Backbone=Llama-3.1-8B-Instruct2026.06 | 32.78 | 48.6 | 41.69 | 42.57 | 66.48 | 59.49 | — | |
| Eval-Skill (workflow-only)Judge Backbone=RRM-7B2026.06 | 32.22 | 55.74 | 41.51 | 59.84 | 76.29 | 68.86 | — | |
| Eval-Skill (adaptive)Judge Backbone=RRM-7B2026.06 | 32.22 | 54.11 | 41.51 | 59.84 | 68.1 | 68.86 | — | |
| Qwen3-4BJudge Backbone=Qwen3-4B and Variants, Rubric Model=Rubric-RM-4B2026.06 | 31.67 | 47.63 | 44.27 | 50.6 | 35.43 | 76.2 | — | |
| DPOModel=Llama-3-8B-Instruct2025.09 | 30.9 | 32.2 | 26.9 | 39.3 | 48.2 | 28.2 | 19.6 | |
| DPOModel=Gemma-2-9B-Instruct2025.09 | 30.6 | 43.1 | 40.4 | 42.8 | 55.1 | 69.2 | 20.7 | |
| RM-R1-14B (DeepSeek-Dist)Backbone=DeepSeek-Dist2026.05 | 30.6 | — | — | — | — | 79 | — | |
| SimUAPOModel=Llama-3-8B-Instruct2025.09 | 30.1 | 36.2 | 33.2 | 38.9 | 51 | 33.8 | 29.9 | |
| SimPOModel=Llama-3-8B-Instruct2025.09 | 30 | 35.8 | 32.3 | 43.2 | 50.9 | 36.3 | 22.1 | |
| Qwen3-8BJudge Backbone=Qwen3-8B and Variants, Rubric Model=w/o2026.06 | 30 | 57.04 | 52.18 | 59.04 | 69.62 | 74.35 | — | |
| RM-R12026.06 | 29.5 | — | 44.9 | 72.6 | 60.7 | 84.4 | — | |
| UAPOModel=Gemma-2-9B-Instruct2025.09 | 29.4 | 45.4 | 41.7 | 43 | 53.2 | 68.9 | 36.1 | |
| DirectJudge Backbone=Llama-3.1-8B-Instruct2026.06 | 28.33 | 37.25 | 33.6 | 43.78 | 40.86 | 39.66 | — | |
| Qwen-3-8B (Rubric+Judge pointwise)Backbone=Qwen-3-8B, Evaluation Protocol=Rubric+Judge pointwise2026.05 | 27 | — | — | — | — | 62.9 | — | |
| Qwen3-4BJudge Backbone=Qwen3-4B and Variants, Rubric Model=w/o2026.06 | 26.67 | 55.8 | 48.8 | 57.43 | 71.33 | 74.77 | — | |
| Eval-Skill (full)Judge Backbone=Llama-3.1-8B-Instruct2026.06 | 26.11 | 47.35 | 40.89 | 44.58 | 83.05 | 42.11 | — | |
| Eval-Skill (adaptive)Judge Backbone=Llama-3.1-8B-Instruct2026.06 | 26.11 | 50.42 | 40.89 | 42.57 | 83.05 | 59.49 | — | |
| SimPOModel=Gemma-2-9B-Instruct2025.09 | 25.8 | 41.7 | 41.5 | 42.6 | 50.2 | 65.1 | 24.8 | |
| SimUAPOModel=Gemma-2-9B-Instruct2025.09 | 25.6 | 44 | 42.2 | 43.3 | 62.1 | 66.3 | 24.2 | |
| RM-R1-14B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst2026.05 | 23.8 | — | — | — | — | 84.6 | — | |
| Eval-Skill (full)Judge Backbone=RRM-7B2026.06 | 23.33 | 49.25 | 35.2 | 57.83 | 68.1 | 61.77 | — | |
| Qwen-3-8B (Rubric+Judge pairwise)Backbone=Qwen-3-8B, Evaluation Protocol=Rubric+Judge pairwise2026.05 | 21.9 | — | — | — | — | 56.6 | — | |
| RM-R1-DS-Qwen-7BJudge Backbone=Other Post-Trained RMs, Rubric Model=w/o2026.06 | 21.67 | 43.08 | 36.36 | 61.45 | 31.52 | 64.39 | — | |
| RM-R1-7B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst2026.05 | 20.6 | — | — | — | — | 76.2 | — | |
| RRM-7BJudge Backbone=Other Post-Trained RMs, Rubric Model=w/o2026.06 | 20.56 | 44.25 | 36 | 56.63 | 43.43 | 64.64 | — | |
| DirectJudge Backbone=RRM-7B2026.06 | 20.56 | 44.25 | 36 | 56.63 | 43.43 | 64.64 | — | |
| API Prompting (Rubric+Judge pointwise)Evaluation Protocol=Rubric+Judge pointwise2026.05 | 14.8 | — | — | — | — | 50.4 | — | |
| RM-R1-7B (DeepSeek-Dist)Backbone=DeepSeek-Dist2026.05 | 13.8 | — | — | — | — | 55.4 | — | |
| API Prompting (direct Judge)Evaluation Protocol=direct Judge2026.05 | 13.2 | — | — | — | — | 63.4 | — | |
| RRM-7BModel Category=White-box Judge/Reward LLMs2026.05 | 10 | — | — | — | — | 60.4 | — | |
| JudgeLRM-7BModel Category=White-box Judge/Reward LLMs2026.05 | 9.4 | — | — | — | — | 29.1 | — | |
| Bradley–TerryBackbone=Qwen3-4B2026.06 | — | 63.5 | — | — | 73.3 | — | — | |
| Bradley–TerryBackbone=Qwen3-8B2026.06 | — | 67.9 | — | — | 78.9 | — | — | |
| DynaCFBackbone=Qwen3-4B2026.06 | — | 66.1 | — | — | 79.4 | — | — | |
| DynaCFBackbone=Qwen3-8B2026.06 | — | 68 | — | — | 81.8 | — | — | |
| Skywork-Reward-Gemma-2-27BBackbone=Gemma-2-27B2026.06 | — | 75.8 | — | — | 94.2 | — | — | |
| Skywork-Reward-Llama-3.1-8BBackbone=Llama-3.1-8B2026.06 | — | 73.1 | — | — | 93.3 | — | — | |
| URM-Llama-3.1-8BBackbone=Llama-3.1-8B2026.06 | — | 73.9 | — | — | 91.8 | — | — |