Reward Modeling on LMArena-like Benchmarks PPE Pref ZH, In-House QA, In-House Writing v1.0
82.3PPE Pref ZH ScoreOpenRS
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Backbone=Qwen3-235B-A22B-Instruct-25072026.02 | 82.3 | 74.4 | 82.9 | 79.9 | |
| Skywork-Reward-V2-Llama-3.1Model Category=Open Scalar Reward Models, Parameters=8B2026.02 | 79.6 | 64 | 76.3 | 73.5 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Backbone=DeepSeek-V3.22026.02 | 78.9 | 75.7 | 79 | 77.9 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Backbone=Qwen3-30B-A3B-Instruct-25072026.02 | 78.4 | 74.5 | 79.8 | 77.6 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Backbone=DeepSeek-V3.12026.02 | 78.1 | 72.7 | 77.3 | 76 | |
| OpenRSModel Category=LLM-as-a-Judge & Rubric System, Backbone=gpt-oss-120b2026.02 | 76.6 | 74.7 | 84.6 | 78.6 | |
| RM-R1-Qwen-InstructModel Category=LLM-as-a-Judge & Generative Reward Models, Parameters=32B2026.02 | 76.3 | 73.1 | 84.3 | 77.9 | |
| RM-R1-DeepSeek-Distill-QwenModel Category=LLM-as-a-Judge & Generative Reward Models, Parameters=32B2026.02 | 75.3 | 71.4 | 77.9 | 74.8 | |
| DeepSeek-GRM (w/ MetaRM)Model Category=LLM-as-a-Judge & Generative Reward Models, Parameters=27B2026.02 | 72.2 | 67.3 | 76.3 | 71.9 | |
| DeepSeek-GRMModel Category=LLM-as-a-Judge & Generative Reward Models, Parameters=27B2026.02 | 71.1 | 67.7 | 75.9 | 71.6 | |
| Internlm2-rewardModel Category=Open Scalar Reward Models, Parameters=20B2026.02 | 69.4 | 67.8 | 60.3 | 66.1 | |
| Llama-3.1-NemotronModel Category=Open Scalar Reward Models, Parameters=70B2026.02 | 68.7 | 61.8 | 77.3 | 68.8 | |
| INF-ORM-Llama3.1Model Category=Open Scalar Reward Models, Parameters=70B2026.02 | 65.7 | 67.2 | 64.5 | 66 | |
| Skywork-Reward-Llama-3.1Model Category=Open Scalar Reward Models, Parameters=8B, Version=v0.22026.02 | 62.2 | 61.7 | 77.7 | 67 | |
| Llama-3-OffsetBias-RMModel Category=Open Scalar Reward Models, Parameters=8B2026.02 | 60.6 | 58.9 | 79.1 | 66.1 | |
| ArmoRM-Llama3Model Category=Open Scalar Reward Models, Parameters=8B, Version=v0.12026.02 | 58.3 | 58.3 | 73.1 | 63.1 | |
| Skywork-Reward-Gemma-2Model Category=Open Scalar Reward Models, Parameters=27B, Version=v0.22026.02 | 57.6 | 56.1 | 66.5 | 60 | |
| LDL-Reward-Gemma-2Model Category=Open Scalar Reward Models, Parameters=27B, Version=v0.12026.02 | 43.3 | 59.1 | 29.7 | 50.2 |