Reward Modeling on Human (test)
74Pairwise AccuracyQwen2.5-0.5B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-0.5BTraining data setup=Weighted-sum & Targetedness ↑2026.03 | 74 | |
| Qwen2.5-0.5BTraining data setup=Weighted-sum & Mistake ID & Location ↑2026.03 | 74 | |
| Qwen2.5-1.5BTraining data setup=Combined2026.03 | 70 | |
| Qwen2.5-1.5BTraining data setup=Weighted-sum & Mistake ID & Location ↑2026.03 | 70 | |
| Gemma-2-2BTraining data setup=Weighted-sum & Mistake ID & Location ↑2026.03 | 70 | |
| Qwen2.5-0.5BTraining data setup=Synthetic2026.03 | 69 | |
| Qwen2.5-0.5BTraining data setup=Combined2026.03 | 69 | |
| Qwen2.5-1.5BTraining data setup=Weighted-sum2026.03 | 69 | |
| Qwen2.5-1.5BTraining data setup=Weighted-sum & Targetedness ↑2026.03 | 69 | |
| Gemma-2-2BTraining data setup=Weighted-sum2026.03 | 69 | |
| Gemma-2-2BTraining data setup=Synthetic2026.03 | 69 | |
| Macina et al. (2025)2026.03 | 69 | |
| Qwen2.5-0.5BTraining data setup=Weighted-sum2026.03 | 68 | |
| Qwen2.5-1.5BTraining data setup=Synthetic2026.03 | 68 | |
| Gemma-2-2BTraining data setup=Weighted-sum & Targetedness ↑2026.03 | 68 | |
| RewardAnything-8B-v12026.03 | 68 | |
| Gemma-2-2BTraining data setup=Combined2026.03 | 67 | |
| Skywork-Reward-V2-Llama-3.1-8B2026.03 | 64 |