Reward Modeling on RM-Bench Chat Hard
83.3AccuracyGemini-2.5-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-Flash2026.02 | 83.3 | |
| RM-R1-32B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=32B2026.02 | 83.1 | |
| RRM-32BSize=32B2026.02 | 81.1 | |
| Rubric-ARM-voting@5voting=52026.02 | 80.7 | |
| RM-R1-32B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=32B2026.02 | 80.3 | |
| RM-R1-14B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=14B2026.02 | 79.8 | |
| Rubric-ARM2026.02 | 79.6 | |
| API (Rubric+Judge)Rubric Model=GPT-4.1-Mini, Judge Model=Gemini-2.5-Flash Lite2026.02 | 79.2 | |
| RM-R1-14B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=14B2026.02 | 78.9 | |
| Rubric-RM-voting@5voting=52026.02 | 75.4 | |
| Rubric-RM2026.02 | 74.1 | |
| Claude-3.5-Sonnet2026.02 | 74 | |
| API (direct Judge)Judge Model=Gemini-2.5-Flash Lite2026.02 | 71.2 | |
| RM-R1-7B (Qwen-2.5-Inst)Backbone=Qwen-2.5-Inst, Size=7B2026.02 | 70 | |
| RRM-7BSize=7B2026.02 | 69.5 | |
| RM-R1-7B (DeepSeek-Dist)Backbone=DeepSeek-Dist, Size=7B2026.02 | 67.3 | |
| Qwen-3-8B (Rubric+Judge)Backbone=Qwen-3-8B2026.02 | 63.6 | |
| REWARDAGENT_MINISearch Engine=false2025.02 | 60.2 | |
| REWARDAGENT_MINISearch Engine=true2025.02 | 59.7 | |
| DeepSeek-R1-Distill-Llama-8B2025.02 | 56.8 | |
| JudgeLRM-7BSize=7B2026.02 | 56.1 | |
| REWARDAGENT_LLAMASearch Engine=false2025.02 | 53.5 | |
| DeepSeek-R12025.02 | 50.1 | |
| REWARDAGENT_LLAMASearch Engine=true2025.02 | 49.9 | |
| o3-mini2025.02 | 38.6 | |
| Skywork-Reward-Gemma-2-27B2025.02 | 35.1 | |
| ArmoRM-Llama3-8B-v0.12025.02 | 34.6 | |
| Skywork-Reward-Llama-3.1-8B-v0.22025.02 | 31.8 | |
| GPT-4o2025.02 | 27.9 | |
| internlm2-20b-reward2025.02 | 26.1 | |
| INF-ORM-Llama3.1-70B2025.02 | 25.1 | |
| Llama3-8B Instruct2025.02 | 20.2 | |
| internlm2-7b-reward2025.02 | 19.9 | |
| GPT-4o mini2025.02 | 15 |