Reward Modeling on LitBench
80.7AccuracyAC-GenRM
Evaluation Results
| Method | Links | |
|---|---|---|
| AC-GenRMBackbone=Qwen3-8B2026.04 | 80.7 | |
| AC-GenRMBackbone=Qwen3-4B2026.04 | 79.6 | |
| AC-GenRMBackbone=Qwen3-1.7B2026.04 | 77.6 | |
| claude-3-7-sonnet-20250219Model Category=Base Models (LLM-as-a-Judge)2026.01 | 76.31 | |
| gpt-5-2025-08-07Model Category=Base Models (LLM-as-a-Judge)2026.01 | 76.17 | |
| RM-NLHF-Qwen-32BModel Category=Our Generative Reward Models, Backbone=Qwen-32B2026.01 | 74.92 | |
| Claude-Sonnet-3.7Category=Baselines2026.04 | 73.1 | |
| AC-GenRMBackbone=Qwen3-0.6B2026.04 | 72.8 | |
| o3-2025-04-16Model Category=Base Models (LLM-as-a-Judge)2026.01 | 72.02 | |
| gemini-2.5-proModel Category=Base Models (LLM-as-a-Judge)2026.01 | 71.81 | |
| ArmoRM-Llama3-8B-v0.1Model Category=Scalar Reward Models, Backbone=Llama3-8B2026.01 | 71.57 | |
| INF-ORM-Llama3.1-70BModel Category=Scalar Reward Models, Backbone=Llama-3.1-70B2026.01 | 71.41 | |
| DeepSeek-R1Category=Baselines2026.04 | 71 | |
| GPT-4.1Category=Baselines2026.04 | 70.2 | |
| deepseek-r1-0528Model Category=Base Models (LLM-as-a-Judge)2026.01 | 70 | |
| DeepSeek-V3Category=Baselines2026.04 | 70 | |
| RM-R1-Qwen-32BModel Category=Specialized Generative Reward Models, Backbone=Qwen-32B2026.01 | 69.34 | |
| BaseBackbone=Qwen3-8B2026.04 | 68.8 | |
| qwen3-maxModel Category=Base Models (LLM-as-a-Judge)2026.01 | 68.59 | |
| qwen-plus-latestModel Category=Base Models (LLM-as-a-Judge)2026.01 | 68.35 | |
| Claude-3.5-HaikuCategory=Baselines2026.04 | 67.5 | |
| RRM-Qwen-32BModel Category=Specialized Generative Reward Models, Backbone=Qwen-32B2026.01 | 67.46 | |
| BaseBackbone=Qwen3-4B2026.04 | 66.6 | |
| Skywork-Reward-Llama-3.1-8B-v0.2Model Category=Scalar Reward Models, Backbone=Llama-3.1-8B2026.01 | 65.93 | |
| RM-NLHF-Qwen-7BModel Category=Our Generative Reward Models, Backbone=Qwen-7B2026.01 | 65.83 | |
| deepseek-v3Model Category=Base Models (LLM-as-a-Judge)2026.01 | 65.36 | |
| gpt-4o-latestModel Category=Base Models (LLM-as-a-Judge)2026.01 | 63.19 | |
| URM-LLaMa-3.1-8BModel Category=Scalar Reward Models, Backbone=Llama-3.1-8B2026.01 | 63.02 | |
| GPT-4.1-MiniCategory=Baselines2026.04 | 63 | |
| R1-Distill-Qwen-32BModel Category=Base Models (LLM-as-a-Judge), Backbone=Qwen-32B2026.01 | 62.06 | |
| R1-Distill-Llama-8BModel Category=Base Models (LLM-as-a-Judge), Backbone=Llama-8B2026.01 | 58.22 | |
| RM-R1-Qwen-7BModel Category=Specialized Generative Reward Models, Backbone=Qwen-7B2026.01 | 57.5 | |
| BaseBackbone=Qwen3-1.7B2026.04 | 54.3 | |
| DeepSeek-R1-Distill-Qwen-7BModel Category=Base Models (LLM-as-a-Judge), Backbone=Qwen-7B2026.01 | 54.18 | |
| RRM-Qwen-7BModel Category=Specialized Generative Reward Models, Backbone=Qwen-7B2026.01 | 53.83 | |
| BaseBackbone=Qwen3-0.6B2026.04 | 47.7 |