Reward Modeling on HH-RLHF helpful core250 (held-out evaluation)
20.155Reward ScoreTEA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| TEAN=2562026.05 | 20.155 | 1.8 | 1.264 | 2.317 | |
| TEAN=1282026.05 | 18.93 | 1.817 | 1.336 | 2.269 | |
| GRPON=2562026.05 | 18.354 | — | — | — | |
| TEAN=642026.05 | 17.674 | 1.94 | 1.502 | 2.356 | |
| GRPON=1282026.05 | 17.113 | — | — | — | |
| TEAN=322026.05 | 16.224 | 1.98 | 1.605 | 2.366 | |
| GRPON=642026.05 | 15.734 | — | — | — | |
| TEAN=162026.05 | 14.555 | 1.911 | 1.583 | 2.272 | |
| GRPON=322026.05 | 14.244 | — | — | — | |
| GRPON=162026.05 | 12.644 | — | — | — | |
| TEAN=82026.05 | 12.55 | 1.792 | 1.482 | 2.123 | |
| GRPON=82026.05 | 10.758 | — | — | — |