Reward Modeling on JudgeBench (Score)
85.2Reward Modeling ScoreSkill-RM (Qwen3.5-122B-A10B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Skill-RM (Qwen3.5-122B-A10B)Method Category=Ours, Backbone=Qwen3.5, Model Size=122B-A10B2026.06 | 85.2 | |
| Skill-RM (Qwen3.5-27B)Method Category=Ours, Backbone=Qwen3.5, Model Size=27B2026.06 | 82.1 | |
| RationaleRM-Qwen3-30B-A3BMethod Category=Generative / reasoning reward models, Backbone=Qwen3, Model Size=30B-A3B2026.06 | 82 | |
| Auto-Rubric-Qwen3-32B (HelpSteer3 rubrics)Method Category=Rubric / resource-based systems, Backbone=Qwen3, Model Size=32B2026.06 | 80.9 | |
| Qwen3.5-27BMethod Category=LLM-as-a-Judge, Model Size=27B2026.06 | 80.8 | |
| Skywork-Reward-V2-Llama-3.1-8BMethod Category=Scalar / learned reward models, Backbone=Llama-3.1, Model Size=8B2026.06 | 80 | |
| RRM-32BMethod Category=Generative / reasoning reward models, Model Size=32B2026.06 | 76 | |
| Skywork-Reward-V2-Qwen3-8BMethod Category=Scalar / learned reward models, Backbone=Qwen3, Model Size=8B2026.06 | 73.4 | |
| TIR-Judge-Zero (Qwen3-8B)Method Category=Agentic / verifier-based judges, Backbone=Qwen3, Model Size=8B2026.06 | 72 | |
| INF-ORM-Llama3.1-70BMethod Category=Scalar / learned reward models, Backbone=Llama3.1, Model Size=70B2026.06 | 70.2 | |
| Qwen3.5-122B-A10BMethod Category=LLM-as-a-Judge, Model Size=122B-A10B2026.06 | 67.1 | |
| RewardAgent (Qwen3.5-27B)Method Category=Agentic / verifier-based judges, Backbone=Qwen3.5, Model Size=27B2026.06 | 66.3 | |
| Claude-3.5-Sonnet JudgeMethod Category=LLM-as-a-Judge2026.06 | 64.8 | |
| GPT-4o JudgeMethod Category=LLM-as-a-Judge2026.06 | 59.8 | |
| RM-R1-DeepSeek-Distill-Qwen-32BMethod Category=Generative / reasoning reward models, Backbone=DeepSeek-Distill-Qwen, Model Size=32B2026.06 | 56.1 | |
| OpenRubrics Rubric-RM-8B-voting@5 (Qwen3-8B)Method Category=Rubric / resource-based systems, Backbone=Qwen3, Model Size=8B2026.06 | 44.4 |