Reward Modeling on UltraFeedback Clean (test)
0.39Kendall's τNominal PL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Nominal PLBackbone=Qwen2.5-7B2026.07 | 0.39 | 50.1 | 17.1 | 0.904 | 69.2 | 73.6 | |
| Robust PLBackbone=Qwen2.5-7B, rho=0.052026.07 | 0.38 | 48.3 | 16.3 | 0.901 | 68.7 | 72.5 | |
| Robust PLBackbone=Qwen2.5-7B, rho=0.102026.07 | 0.376 | 48 | 16 | 0.9 | 68.5 | 73.5 | |
| Nominal BTBackbone=Qwen2.5-7B2026.07 | 0.333 | 45.2 | 14 | 0.888 | 66.3 | 69.6 |