Reward Modeling on UltraFeedback core500 (held-out)
0.467bo1 ScoreTEA
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| TEA2026.05 | 0.467 | 11.193 | 12.504 | 13.675 | 14.708 | 1.342 | 1.307 | |
| GRPO-Z2026.05 | 0.314 | 10.608 | 11.889 | 13.034 | 14.06 | 0.701 | 0.66 | |
| Prefix-TEA2026.05 | 0.298 | 11.107 | 12.409 | 13.575 | 14.618 | 1.242 | 1.218 | |
| GRPO2026.05 | -1.172 | 9.85 | 11.179 | 12.334 | 13.4 | 0 | 0 |