Reward Modeling on RewardBench latest (test)
74.9AccuracyTwo-anchor-Skywork
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 74.9 | 0.1997 | 0.5898 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 73.5 | 0.1983 | 0.5822 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 73.5 | 0.206 | 0.6017 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 72.7 | 0.1983 | 0.6085 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 72.2 | 0.2038 | 0.5958 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 71.7 | 0.2099 | 0.636 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 71.7 | 0.2155 | 0.6301 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 71.6 | 0.2046 | 0.7231 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 71.5 | 0.202 | 0.6308 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 71.3 | 0.2393 | 0.7217 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 70.6 | 0.2364 | 0.7153 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 70.3 | 0.2225 | 0.6508 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 70 | 0.2197 | 0.7331 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 69.1 | 0.2217 | 0.8144 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 68.7 | 0.2192 | 0.7195 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 68.6 | 0.2703 | 1.2759 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 67 | 0.2164 | 0.6263 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 65.7 | 0.2366 | 0.9594 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 64.8 | 0.2518 | 0.8945 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 58.6 | 0.3096 | 1.1299 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 58.6 | 0.2409 | 0.6808 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 55.6 | 0.2397 | 0.6728 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 48.1 | 0.2644 | 0.7294 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 44.7 | 0.2635 | 0.7263 |