Reward Modeling on RewardBench External Evaluation
93.3Chat ScoreNominal PL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Nominal PLModel=Qwen3-8B, K=4, Training=clean2026.07 | 93.3 | 45 | 56.9 | 52.9 | 62 | |
| Robust PL (ρ = 0.05)Model=Qwen3-8B, K=4, Training=clean2026.07 | 93 | 43 | 58.2 | 53.6 | 61.96 | |
| Nominal BTModel=Qwen3-8B, K=4, Training=clean2026.07 | 90.5 | 46.5 | 55.3 | 51.5 | 60.9 | |
| Nominal BTModel=Qwen3-0.6B, K=4, Training=clean2026.07 | 89.1 | 41 | 45.7 | 68.6 | 61.1 | |
| Robust PL (ρ = 0.05)Model=Qwen3-0.6B, K=4, Training=clean2026.07 | 88.3 | 42.5 | 47 | 72.7 | 62.6 | |
| Nominal PLModel=Qwen3-0.6B, K=4, Training=clean2026.07 | 86.3 | 40.6 | 46.2 | 71.5 | 61.2 |