Reward Model Evaluation on RewardBench (test)
1.65KuiperConsistency
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ConsistencyModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | 1.65 | 2.48 | |
| MajorityModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | 1.66 | 2.82 | |
| VerbalizedModel=GPT-OSS 20B2025.12 | 1.98 | 1.91 | |
| ProbeModel=LLAMA Scout (109B)2025.12 | 6.83 | 8.79 | |
| VerbalizedModel=LLAMA Scout (109B)2025.12 | 7.42 | 6.71 | |
| ProbeModel=GPT-OSS 20B2025.12 | 14.04 | 19.17 | |
| MajorityModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | 21.78 | 19.96 | |
| ConsistencyModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | 22.33 | 20.37 |