Reward Modeling on RewardBench 2
93.4L-AccGPT-5-chat
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-5-chatCategory=LLM-as-Judge, Mode=chat2026.02 | 93.4 | 10.3 | 83.7 | — | — | |
| Claude-Sonnet-4.5-thinkingCategory=LLM-as-Judge, Mode=thinking2026.02 | 93.1 | 5.1 | 88.3 | — | — | |
| GPT-5-thinkingCategory=LLM-as-Judge, Mode=thinking2026.02 | 92.6 | 3.4 | 89.4 | — | — | |
| Gemini-3-ProCategory=LLM-as-Judge, Tier=Pro2026.02 | 92 | 1.7 | 90.4 | — | — | |
| GenRM-R-Align-14BCategory=Our Methods, Parameters=14B, Training=R-Align2026.02 | 92 | 14.6 | 78.5 | — | — | |
| DeepSeek-V3.2-thinkingCategory=LLM-as-Judge, Mode=thinking2026.02 | 91.9 | 18.9 | 74.5 | — | — | |
| Claude-Sonnet-4.5Category=LLM-as-Judge2026.02 | 91.6 | 9.4 | 83 | — | — | |
| GPT-OSS-120BCategory=LLM-as-Judge, Parameters=120B2026.02 | 90.6 | 16.2 | 75.9 | — | — | |
| DeepSeek-V3.2-chatCategory=LLM-as-Judge, Mode=chat2026.02 | 90.2 | 13.9 | 77.7 | — | — | |
| Gemini-2.5-ProCategory=LLM-as-Judge, Tier=Pro2026.02 | 90.1 | 4.8 | 85.7 | — | — | |
| GenRM-R-Align-8BCategory=Our Methods, Parameters=8B, Training=R-Align2026.02 | 89.8 | 21.7 | 70.3 | — | — | |
| GenRM-RLVR-8BCategory=Our Methods (Baseline), Parameters=8B, Training=RLVR2026.02 | 89.2 | 25.9 | 66.1 | — | — | |
| RRM-32BCategory=Specialized Generative Reward Models, Parameters=32B2026.02 | 88.5 | 36.7 | 56 | — | — | |
| GenRM-RLVR-14BCategory=Our Methods (Baseline), Parameters=14B, Training=RLVR2026.02 | 88.1 | 29 | 62.5 | — | — | |
| Qwen3-14BCategory=Our Methods (Baseline), Parameters=14B2026.02 | 87.9 | 20.1 | 70.2 | — | — | |
| Qwen3-4B-Thinking-2507Category=LLM-as-Judge, Parameters=4B, Mode=Thinking2026.02 | 87.8 | 19.3 | 70.9 | — | — | |
| RM-R1-Qwen-32BCategory=Specialized Generative Reward Models, Parameters=32B2026.02 | 87.1 | 18.3 | 71.2 | — | — | |
| Qwen3-4B-Instruct-2507Category=LLM-as-Judge, Parameters=4B, Mode=Instruct2026.02 | 85.3 | 27.4 | 61.9 | — | — | |
| RM-R1-DS-32BCategory=Specialized Generative Reward Models, Parameters=32B2026.02 | 84.2 | 25 | 63.2 | — | — | |
| Qwen3-8BCategory=Our Methods (Baseline), Parameters=8B2026.02 | 82.7 | 24.6 | 62.4 | — | — | |
| BaselineCondition=Baseline2026.02 | — | — | — | — | 70.1 | |
| CIR-AMS/BTRM_Qwen2_7b_06132025.07 | — | — | — | 57.4 | — | |
| INF-ORM-Llama3.1-70B2025.07 | — | — | — | 76.5 | — | |
| mechanistic reward shapingCondition=Length2026.02 | — | — | — | — | 69.3 | |
| mechanistic reward shapingCondition=Position2026.02 | — | — | — | — | 69.3 | |
| mechanistic reward shapingCondition=Uncertainty2026.02 | — | — | — | — | 70.1 | |
| mechanistic reward shapingCondition=Combined2026.02 | — | — | — | — | 69.3 | |
| Ray2333/GRM-gemma2-2B-rewardmodel-ft2025.07 | — | — | — | 59.7 | — | |
| Skywork-Reward-V2Backbone=Qwen2.5-7B2025.07 | — | — | — | 67.2 | — | |
| Skywork-Reward-V2Backbone=gemma-2-2b-it2025.07 | — | — | — | 66.6 | — | |
| Skywork-Reward-V2Backbone=gemma-2-9b-it2025.07 | — | — | — | 78.1 | — | |
| Skywork-Reward-V2Backbone=gemma-3-1b-it2025.07 | — | — | — | 69.8 | — | |
| Skywork-Reward-V2Backbone=gemma-3-4b2025.07 | — | — | — | 71 | — |