Reward Model Learning on UFB
72.5Win RateURM
Evaluation Results
| Method | Links | |
|---|---|---|
| URMBase Model=Llama-3.1-8B2026.07 | 72.5 | |
| α-URMBase Model=Llama-3.1-8B2026.07 | 72.3 | |
| RMBase Model=Llama-3.1-8B2026.07 | 68.9 | |
| cRMBase Model=Llama-3.1-8B2026.07 | 66.5 | |
| α-URMBase Model=Qwen-3-8B2026.07 | 64.9 | |
| URMBase Model=Qwen-3-8B2026.07 | 64.6 | |
| rRMBase Model=Qwen-3-8B2026.07 | 63.9 | |
| rRMBase Model=Llama-3.1-8B2026.07 | 63.6 | |
| RMBase Model=Qwen-3-8B2026.07 | 54.3 | |
| cRMBase Model=Qwen-3-8B2026.07 | 52.9 |