Preference Prediction on RewardBench 2
73.9AccuracyReasoning RM + External-Rubric (32B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Reasoning RM + External-Rubric (32B)Backbone=Qwen3-8B2026.04 | 73.9 | |
| C2Backbone=Qwen3-8B2026.04 | 71 | |
| Base ModelBackbone=Qwen3-8B2026.04 | 69.7 | |
| Reasoning RM + Self-RubricBackbone=Qwen3-8B2026.04 | 69.4 | |
| Reasoning RMBackbone=Qwen3-8B2026.04 | 67.6 | |
| Reasoning RM + External-Rubric (32B)Backbone=Tulu3-8B-SFT2026.04 | 59.6 | |
| C2Backbone=Tulu3-8B-SFT2026.04 | 50.7 | |
| Reasoning RMBackbone=Tulu3-8B-SFT2026.04 | 45.6 | |
| Reasoning RM + Self-RubricBackbone=Tulu3-8B-SFT2026.04 | 40.8 | |
| Base ModelBackbone=Tulu3-8B-SFT2026.04 | 35.2 |