Reward Modeling on EvalBiasBench
0.75AccuracyQwen3-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-14BRole=Student2026.01 | 0.75 | |
| GPT-4oRole=Student2026.01 | 0.7 | |
| RM-DistillerStudent=Qwen2.5-3B-Instruct, Teacher=Qwen3-14B2026.01 | 0.638 | |
| RM-DistillerStudent=Qwen2.5-3B-Instruct, Teacher=GPT-4o2026.01 | 0.575 | |
| BT ClassifierStudent=Qwen2.5-3B-Instruct, Teacher=Qwen3-14B2026.01 | 0.475 | |
| Qwen2.5-3B-InstructRole=Student2026.01 | 0.444 | |
| BT ClassifierStudent=Qwen2.5-3B-Instruct, Teacher=GPT-4o2026.01 | 0.3 |