Reward Modeling on UltraFeedback Near-tie 0.4 noisy (test)
0.37Kendall’s TauRobust PL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Robust PLBackbone=Qwen2.5-7B, rho=0.102026.07 | 0.37 | 44.8 | 14.5 | 0.903 | 68.2 | 72.2 | |
| Robust PLBackbone=Qwen2.5-7B, rho=0.052026.07 | 0.37 | 46.3 | 14.5 | 0.903 | 68.2 | 73.9 | |
| Nominal PLBackbone=Qwen2.5-7B2026.07 | 0.368 | 44.4 | 13.9 | 0.903 | 68.1 | 73.6 | |
| Nominal BTBackbone=Qwen2.5-7B2026.07 | 0.365 | 45.3 | 13.7 | 0.901 | 67.9 | 72 |