Reward Modeling on PMDC Maximum Discrepancy samples
1RankSkywork-Reward-Gemma-2-27B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Skywork-Reward-Gemma-2-27BBackbone=Gemma-2, Parameters=27B2026.01 | 1 | 2.488 | 91.6 | |
| QRM-Gemma-2-27BBackbone=Gemma-2, Parameters=27B2026.01 | 2 | 1.271 | 74.8 | |
| Reward-Model-Mistral-7B-instruct-unifiedBackbone=Mistral, Parameters=7B, Variant=instruct-unified2026.01 | 3 | 0.753 | 65.3 | |
| URM-LLaMa-3.1-8BBackbone=LLaMa-3.1, Parameters=8B2026.01 | 4 | 0.065 | 49.9 | |
| ArmoRM-Llama3-8B-v0.1Backbone=Llama3, Parameters=8B, Version=v0.12026.01 | 5 | 0 | 48.3 | |
| Skywork-Reward-Llama-3.1-8BBackbone=Llama-3.1, Parameters=8B2026.01 | 6 | -0.185 | 44.1 | |
| Skywork-Reward-V2-Qwen2-8BBackbone=Qwen2, Parameters=8B, Version=V22026.01 | 7 | -0.455 | 37.6 | |
| Reward-Model-Deberta-v3-large-v2Backbone=Deberta-v3-large, Version=v22026.01 | 8 | -0.507 | 36.7 | |
| Skywork-Reward-V2-Llama-3.2-3BBackbone=Llama-3.2, Parameters=3B, Version=V22026.01 | 9 | -1.007 | 26 | |
| Skywork-Reward-V2-Llama-3.1-8BBackbone=Llama-3.1, Parameters=8B, Version=V22026.01 | 10 | -1.059 | 24.9 |