Reward Modeling on PPE-P latest (test)
60.2AccuracyTwo-anchor-Skywork
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 60.2 | 0.2535 | 0.7878 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 59 | 0.276 | 0.8827 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 59 | 0.2908 | 1.0017 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 59 | 0.2552 | 0.748 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 58.8 | 0.2453 | 0.702 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 58.5 | 0.3097 | 1.2321 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 58.4 | 0.2483 | 0.7065 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 58.3 | 0.2578 | 0.7609 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 58.2 | 0.2491 | 0.7064 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer3-20K2026.05 | 58 | 0.2745 | 0.9378 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 57.8 | 0.2595 | 0.7519 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=PersonalLLM-40K2026.05 | 57.5 | 0.2616 | 0.7592 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 57.4 | 0.2414 | 0.6783 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 57.4 | 0.2407 | 0.6761 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 57.3 | 0.2413 | 0.6786 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 56.9 | 0.2522 | 0.7135 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 56.8 | 0.2458 | 0.6873 | |
| Two-anchor-SkyworkBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 56.8 | 0.2465 | 0.6925 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 56.7 | 0.2413 | 0.6766 | |
| GaussianBackbone=Llama-3.2-1B-Instruct, Training Dataset=HelpSteer2-9K2026.05 | 56.3 | 0.263 | 0.768 | |
| BT(Hard)Backbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 56.2 | 0.2876 | 0.8883 | |
| Two-anchor-DeepSeek-ProBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 56.2 | 0.2428 | 0.6793 | |
| Two-anchor-DeepSeek-FlashBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 55.7 | 0.2441 | 0.6828 | |
| BTBackbone=Llama-3.2-1B-Instruct, Training Dataset=MultiPref-8K2026.05 | 55.6 | 0.2481 | 0.6958 |