Reward Modeling on IFBench (test)
57.9AccuracyRM-Distiller
Evaluation Results
| Method | Links | |
|---|---|---|
| RM-DistillerStudent=Qwen2.5-3B-Instruct, Teacher=GPT-4o2026.01 | 57.9 | |
| RM-DistillerStudent=Qwen2.5-3B-Instruct, Teacher=Qwen3-14B2026.01 | 57.7 | |
| Qwen3-14B2026.01 | 54.2 | |
| BT ClassifierStudent=Qwen2.5-3B-Instruct, Teacher=Qwen3-14B2026.01 | 52.5 | |
| GPT-4o2026.01 | 50.8 | |
| BT ClassifierStudent=Qwen2.5-3B-Instruct, Teacher=GPT-4o2026.01 | 50.2 | |
| Qwen2.5-3B-Instruct2026.01 | 36.9 |