Reward Modeling on RewardBench 2 (accuracy)
89.5AccuracySkywork-Llama
Evaluation Results
| Method | Links | |
|---|---|---|
| Skywork-LlamaReward Shaping=Length2026.02 | 89.5 | |
| Skywork-LlamaReward Shaping=Baseline2026.02 | 89.4 | |
| Skywork-LlamaReward Shaping=Position2026.02 | 89.4 | |
| Skywork-LlamaReward Shaping=Confidence2026.02 | 89.4 | |
| Skywork-LlamaReward Shaping=Uncertainty2026.02 | 89.3 | |
| Skywork-LlamaReward Shaping=Combined2026.02 | 88.9 | |
| Skywork-Qwen8BReward Shaping=Uncertainty2026.02 | 86 | |
| Skywork-Qwen8BReward Shaping=Confidence2026.02 | 85.5 | |
| Skywork-Qwen8BReward Shaping=Baseline2026.02 | 85.4 | |
| Skywork-Qwen8BReward Shaping=Length2026.02 | 85.4 | |
| Skywork-Qwen8BReward Shaping=Combined2026.02 | 85.4 | |
| Skywork-Qwen8BReward Shaping=Position2026.02 | 85.3 | |
| AllenAIReward Shaping=Baseline2026.02 | 79.8 | |
| AllenAIReward Shaping=Uncertainty2026.02 | 79.6 | |
| AllenAIReward Shaping=Confidence2026.02 | 79.2 | |
| AllenAIReward Shaping=Position2026.02 | 79.1 | |
| AllenAIReward Shaping=Length2026.02 | 77.9 | |
| AllenAIReward Shaping=Combined2026.02 | 77.9 | |
| Skywork-Qwen0.6BReward Shaping=Position2026.02 | 69.9 | |
| Skywork-Qwen0.6BReward Shaping=Uncertainty2026.02 | 69.9 | |
| Skywork-Qwen0.6BReward Shaping=Confidence2026.02 | 69.9 | |
| Skywork-Qwen0.6BReward Shaping=Baseline2026.02 | 69.8 | |
| Skywork-Qwen0.6BReward Shaping=Length2026.02 | 69 | |
| Skywork-Qwen0.6BReward Shaping=Combined2026.02 | 68.1 | |
| DeBERTaReward Shaping=Baseline2026.02 | 26.4 | |
| DeBERTaReward Shaping=Combined2026.02 | 25.6 | |
| DeBERTaReward Shaping=Position2026.02 | 24.3 | |
| DeBERTaReward Shaping=Length2026.02 | 24.2 | |
| DeBERTaReward Shaping=Uncertainty2026.02 | 24.2 | |
| DeBERTaReward Shaping=Confidence2026.02 | 24.1 |