Reward Modeling on UltraFeedback Top-rank 0.4 noisy (test)
0.356Kendall's TauRobust PL
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Robust PLBackbone=Qwen2.5-7B, rho=0.052026.07 | 0.356 | 43.9 | 14.8 | 89.7 | 67.5 | 68.9 | |
| Nominal PLBackbone=Qwen2.5-7B2026.07 | 0.341 | 43.8 | 12.8 | 89 | 66.6 | 67.4 | |
| Robust PLBackbone=Qwen2.5-7B, rho=0.102026.07 | 0.338 | 43.8 | 13.4 | 89.4 | 67.8 | 68.1 | |
| Nominal BTBackbone=Qwen2.5-7B2026.07 | 0.138 | 31.9 | 8.3 | 85 | 56.6 | 58.1 |