Reward Modeling on MT Bench
91.4AccuracyUltraRM-13B
Evaluation Results
| Method | Links | |
|---|---|---|
| UltraRM-13BType=Seq. Classifier, #Data=64K (Cui et al., 2024)2025.03 | 91.4 | |
| Tulu-v2.5-RM-13BType=Seq. Classifier, #Data=2M (Ivison et al., 2024)2025.03 | 91.4 | |
| Llama-distType=Generative, #Data=21K (Wang et al., 2024b)2025.03 | 88.1 | |
| Llama-sftType=Generative, #Data=21K (Wang et al., 2024b)2025.03 | 87.3 | |
| GPT-3.5Type=Generative, #Data=-2025.03 | 83.3 | |
| Claude-3-haikuType=Generative, #Data=-2025.03 | 82.9 | |
| BT-BNRMBackbone=Gemma2 2B it, Training Scale=Unified-Feedback 40K2026.02 | 76.8 | |
| Prometheus-2-7BType=Generative, #Data=300K (Kim et al., 2024a)2025.03 | 75.8 | |
| BT-BNRMBackbone=Gemma 2B it, Training Scale=Unified-Feedback 40K2026.02 | 75.2 | |
| BTBackbone=Gemma2 2B it, Training Scale=Unified-Feedback 40K2026.02 | 73.3 | |
| BTBackbone=Gemma 2B it, Training Scale=Unified-Feedback 40K2026.02 | 69.1 | |
| Llama-binaryType=Seq. Classifier, #Data=21K (Wang et al., 2024b)2025.03 | 62.8 | |
| Tulu-v2.5-RM-13BType=Seq. Classifier, #Data=64K (Cui et al., 2024)2025.03 | 56.2 |