Reward Modeling on RewardBench (test)
0.933RWBenchJ1-Llama-70B
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| J1-Llama-70BRM Type=Pairwise, Training Data=22K2026.01 | 0.933 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RISE-Judge-32BRM Type=Pairwise, Training Data=40K2026.01 | 0.927 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CompassJudger2-32BRM Type=Pairwise, Training Data=?2026.01 | 0.926 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RM-R1-Qwen-32BRM Type=Pairwise, Training Data=73K2026.01 | 0.914 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RRM-32BRM Type=Pairwise, Training Data=420K2026.01 | 0.912 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CompassJudger2-7BRM Type=Pairwise, Training Data=?2026.01 | 0.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Think-J-32BRM Type=Pairwise, Training Data=9.8K2026.01 | 0.905 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-RM-4BRM Type=Pointwise, Training Data=5.7K, Scaling=42026.01 | 0.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-RM-4BRM Type=Pointwise, Training Data=5.7K, Scaling=22026.01 | 0.894 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CE-RM-4BRM Type=Pointwise, Training Data=5.7K, Scaling=12026.01 | 0.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RISE-Judge-7BRM Type=Pairwise, Training Data=73K2026.01 | 0.882 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4oRM Type=Pairwise, Training Data=-2026.01 | 0.867 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-GRM-27BRM Type=Pointwise, Training Data=237K2026.01 | 0.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| J1-Llama-8BRM Type=Pairwise, Training Data=22K2026.01 | 0.857 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama-3.3-70B-InstructRM Type=Pairwise, Training Data=-2026.01 | 0.854 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RM-R1-Qwen-7BRM Type=Pairwise, Training Data=73K2026.01 | 0.852 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RRM-7BRM Type=Pairwise, Training Data=420K2026.01 | 0.822 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLoud-Gemma-2-27BRM Type=Pointwise, Training Data=237K2026.01 | 0.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIR-Judge-Zero-8BRM Type=Pointwise, Training Data=26K2026.01 | 0.814 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CompassJudger1-32BRM Type=Pointwise, Training Data=900K2026.01 | 0.812 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIR-Judge-Distill-8BRM Type=Pointwise, Training Data=26K2026.01 | 0.81 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-FlashRM Type=Pointwise, Training Data=-2026.01 | 0.807 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIR-Judge-Zero-4BRM Type=Pointwise, Training Data=26K2026.01 | 0.773 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TIR-Judge-Distill-4BRM Type=Pointwise, Training Data=26K2026.01 | 0.766 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| JudgeLRM-7BRM Type=Pairwise, Training Data=100K2026.01 | 0.752 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCPSnM=502026.05 | — | — | — | — | — | — | — | — | — | — | — | — | 0.0252 | 0.0219 | 0.33 | 0.13 | — | |
| FCPSnM=1002026.05 | — | — | — | — | — | — | — | — | — | — | — | — | 0.0249 | 0.0225 | 0.25 | 0.12 | — | |
| FCPSnM=2002026.05 | — | — | — | — | — | — | — | — | — | — | — | — | 0.0251 | 0.022 | 0.32 | 0.17 | — | |
| FCPSnM=4002026.05 | — | — | — | — | — | — | — | — | — | — | — | — | 0.0243 | 0.0217 | 0.26 | 0.15 | — | |
| FCPSnM=8002026.05 | — | — | — | — | — | — | — | — | — | — | — | — | 0.024 | 0.0227 | 0.14 | -0.01 | — | |
| FsfairXReward Model=FsfairX, Protocol=Vanilla2026.04 | — | 95.14 | 77.93 | 93.24 | 75.63 | 79.48 | 82.49 | 90.78 | 71.13 | 94 | 66.67 | 86.68 | — | — | — | — | — | |
| FsfairX + CIRMReward Model=FsfairX, Protocol=CIRM2026.04 | — | 95.25 | 78.02 | 93.69 | 74.91 | 79.48 | 83.27 | 91.49 | 72.16 | 94 | 66.67 | 86.8 | — | — | — | — | — | |
| FsfairX + LPReward Model=FsfairX, Protocol=LP2026.04 | — | 93.45 | 85.12 | 91.58 | 86.57 | 86.71 | 85.99 | 91.49 | 77.32 | 92 | 66.67 | 89.67 | — | — | — | — | — | |
| FsfairX + LWRReward Model=FsfairX, Protocol=LWR2026.04 | — | 93.45 | 85.95 | 91.58 | 87.04 | 87.57 | 86.38 | 91.49 | 78.35 | 92 | 66.67 | 90.08 | — | — | — | — | — | |
| GRMReward Model=GRM, Protocol=Vanilla2026.04 | — | 89.94 | 89.34 | 92.79 | 90.68 | 92.2 | 89.88 | 94.33 | 85.57 | 94 | 100 | 88.96 | — | — | — | — | — | |
| GRM + CIRMReward Model=GRM, Protocol=CIRM2026.04 | — | 90.17 | 89.42 | 93.69 | 89.61 | 91.62 | 90.27 | 94.33 | 85.57 | 94 | 100 | 89.13 | — | — | — | — | — | |
| GRM + LPReward Model=GRM, Protocol=LP2026.04 | — | 88.14 | 90.99 | 89.47 | 92.59 | 92.77 | 89.49 | 93.62 | 87.63 | 92 | 100 | 89.13 | — | — | — | — | — | |
| GRM + LWRReward Model=GRM, Protocol=LWR2026.04 | — | 90.62 | 88.35 | 93.68 | 87.5 | 91.04 | 90.66 | 93.62 | 85.57 | 94 | 100 | 88.71 | — | — | — | — | — | |
| INFReward Model=INF, Protocol=Vanilla2026.04 | — | 96.72 | 95.7 | 97.75 | 93.91 | 97.4 | 95.72 | 97.87 | 90.72 | 98 | 66.67 | 96.6 | — | — | — | — | — | |
| JudgeLRM-7BBackbone=Qwen-2.5-7B-Instruct, Training Data Size=100K2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.45 | |
| OPENREWARDBackbone=Qwen-2.5-7B-Instruct, Training Data Size=27K2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.66 | |
| Prometheus-v2.0Backbone=Mistral-7B-Instruct, Training Data Size=200K2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.55 | |
| RM-R1Backbone=Qwen-2.5-7B-Instruct, Training Data Size=72K2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.34 | |
| RRM-7BBackbone=Qwen-2.5-7B-Instruct, Training Data Size=420K2025.10 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 78.54 |