Reward Modeling on RewardBench v1
95.5AccuracyDeepSeek-V3.2
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-V3.22026.03 | 95.5 | |
| Gemini-3-Flash2026.03 | 95.3 | |
| Skywork-Reward-8BStage=BT, Data=44K2026.03 | 93.9 | |
| Mix-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 91.8 | |
| Ray2333/GRM-llama3.2-3B-rewardmodel-ftParams (B)=3.0, Type=Seq. Classifier2026.02 | 90.9 | |
| Skywork/Skywork-VL-Reward-7BParams (B)=7.0, Type=Seq. Classifier2026.02 | 90.07 | |
| Base-GRMStage=SFT, RL, Data=9K, 21K2026.03 | 89 | |
| R-I-S-E/RISE-Judge-Qwen2.5-7BParams (B)=7.0, Type=Generative2026.02 | 88.191 | |
| Mix-GRMStage=SFT, Data=9K2026.03 | 87.2 | |
| RubricRM-8BStage=SFT, Data=36K2026.03 | 86.7 | |
| FARE-8BStage=SFT, Data=2.5M2026.03 | 86.3 | |
| Base-GRMStage=SFT, Data=9K2026.03 | 84.5 | |
| RM-R1-7B (Distill)Stage=SFT, RL, Data=9K, 64K2026.03 | 83.5 | |
| RM-R1-7B (Instruct)Stage=SFT, RL, Data=9K, 64K2026.03 | 82.3 | |
| JudgeLRM-7BStage=RL, Data=100K2026.03 | 79 | |
| DeepSeek-GRM-16BStage=SFT, RL, Data=1.2M, 237K2026.03 | 76.8 | |
| stabilityai/stablelm-zephyr-3bParams (B)=3.0, Type=DPO2026.02 | 74 | |
| opencompass/CompassJudger-1-1.5B-InstructParams (B)=1.5, Type=Generative2026.02 | 73.4 | |
| Finemath-RM-Qwen-2.5-3BParams (B)=3.0, Type=Seq. Classifier2026.02 | 70 | |
| OpenAssistant/oasst-rm-2.1-pythia-1.4b-epoch-2.5Params (B)=1.4, Type=Seq. Classifier2026.02 | 69.5 | |
| Finemath-RM-Llama-3.2-3BParams (B)=3.0, Type=Seq. Classifier2026.02 | 65.6 | |
| stabilityai/stable-code-instruct-3bParams (B)=3.0, Type=DPO2026.02 | 64.3 | |
| Finemath-RM-Llama-3.2-1BParams (B)=1.0, Type=Seq. Classifier2026.02 | 60 | |
| Qwen/Qwen1.5-4B-ChatParams (B)=4.0, Type=DPO2026.02 | 56 | |
| ContextualAI/archangel_sft-kto_pythia1-4bParams (B)=4.0, Type=DPO2026.02 | 55.9 | |
| Qwen/Qwen1.5-0.5B-ChatParams (B)=0.5, Type=DPO2026.02 | 53.8 | |
| ContextualAI/archangel_sft-dpo_pythia1-4bParams (B)=4.0, Type=DPO2026.02 | 52.1 | |
| weqweasdas/hh_rlhf_rm_open_llama_3bParams (B)=3.0, Type=Seq. Classifier2026.02 | 48.4 |