Reward Modeling on RewardBench2 (Score)
85ScoreSkill-RM (Qwen3.5-27B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Skill-RM (Qwen3.5-27B)Method Category=Ours, Backbone=Qwen3.5, Model Size=27B2026.06 | 85 | |
| Skywork-Reward-V2-Llama-3.1-8BMethod Category=Scalar / learned reward models, Backbone=Llama-3.1, Model Size=8B2026.06 | 84.1 | |
| Skill-RM (Qwen3.5-122B-A10B)Method Category=Ours, Backbone=Qwen3.5, Model Size=122B-A10B2026.06 | 82.9 | |
| Auto-Rubric-Qwen3-32B (HelpSteer3 rubrics)Method Category=Rubric / resource-based systems, Backbone=Qwen3, Model Size=32B2026.06 | 82.3 | |
| RewardAgent (Qwen3.5-27B)Method Category=Agentic / verifier-based judges, Backbone=Qwen3.5, Model Size=27B2026.06 | 82 | |
| Qwen3.5-27BMethod Category=LLM-as-a-Judge, Model Size=27B2026.06 | 81.1 | |
| Qwen3.5-122B-A10BMethod Category=LLM-as-a-Judge, Model Size=122B-A10B2026.06 | 79 | |
| Skywork-Reward-V2-Qwen3-8BMethod Category=Scalar / learned reward models, Backbone=Qwen3, Model Size=8B2026.06 | 78.2 | |
| INF-ORM-Llama3.1-70BMethod Category=Scalar / learned reward models, Backbone=Llama3.1, Model Size=70B2026.06 | 76.5 | |
| TIR-Judge-Zero (Qwen3-8B)Method Category=Agentic / verifier-based judges, Backbone=Qwen3, Model Size=8B2026.06 | 73.4 | |
| RM-R1-DeepSeek-Distill-Qwen-32BMethod Category=Generative / reasoning reward models, Backbone=DeepSeek-Distill-Qwen, Model Size=32B2026.06 | 71 | |
| RRM-32BMethod Category=Generative / reasoning reward models, Model Size=32B2026.06 | 70.1 | |
| OpenRubrics Rubric-RM-8B-voting@5 (Qwen3-8B)Method Category=Rubric / resource-based systems, Backbone=Qwen3, Model Size=8B2026.06 | 67.3 | |
| GPT-4o JudgeMethod Category=LLM-as-a-Judge2026.06 | 64.9 | |
| Claude-3.5-Sonnet JudgeMethod Category=LLM-as-a-Judge2026.06 | 64.7 |