Reward Model Evaluation on RewardBench (Spearman ρ)
0.542Spearman ρprob-weighted EV (M2)
Evaluation Results
| Method | Links | |
|---|---|---|
| prob-weighted EV (M2)Model=Gemma-3-27B2026.05 | 0.542 | |
| zero-shot BDAS-1D (M4)Model=Gemma-3-27B2026.05 | 0.537 | |
| prompted argmax (M1)Model=Gemma-3-27B2026.05 | 0.522 | |
| supervised residual probe (M3)Model=Gemma-3-27B2026.05 | 0.487 | |
| prob-weighted EV (M2)Model=Gemma-3-12B2026.05 | 0.432 | |
| zero-shot BDAS-1D (M4)Model=Gemma-3-12B2026.05 | 0.425 | |
| prompted argmax (M1)Model=Gemma-3-12B2026.05 | 0.422 | |
| prob-weighted EV (M2)Model=Qwen2.5-14B2026.05 | 0.418 | |
| prompted argmax (M1)Model=Qwen2.5-14B2026.05 | 0.413 | |
| supervised residual probe (M3)Model=Qwen2.5-14B2026.05 | 0.398 | |
| supervised residual probe (M3)Model=Gemma-3-12B2026.05 | 0.375 | |
| prob-weighted EV (M2)Model=Qwen2.5-7B2026.05 | 0.367 | |
| zero-shot BDAS-1D (M4)Model=Qwen2.5-14B2026.05 | 0.345 | |
| zero-shot BDAS-1D (M4)Model=Qwen2.5-7B2026.05 | 0.338 | |
| prompted argmax (M1)Model=Qwen2.5-7B2026.05 | 0.327 | |
| supervised residual probe (M3)Model=Llama-3.1-8B2026.05 | 0.32 | |
| zero-shot BDAS-1D (M4)Model=Llama-3.1-8B2026.05 | 0.298 | |
| supervised residual probe (M3)Model=Qwen2.5-7B2026.05 | 0.291 | |
| prompted argmax (M1)Model=Llama-3.1-8B2026.05 | 0.276 | |
| prob-weighted EV (M2)Model=Llama-3.1-8B2026.05 | 0.241 |