Reward Modeling on Unified-Feedback ID (test)
71.5Reward ScoreGRM w/ sft
Evaluation Results
| Method | Links | |
|---|---|---|
| GRM w/ sftBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 71.5 | |
| GRM w/ dpo-norefBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 71.4 | |
| GRM w/ dpoBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 70.2 | |
| Classifier + EnsembleBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 69.9 | |
| Classifier + marginBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 69.6 | |
| Classifier (baseline)Base Model=gemma-2B-it, Training Data Size=40K2024.06 | 68.8 | |
| Classifier + label smoothBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 68.5 | |
| Classifier (Frozen)Base Model=gemma-2B-it, Training Data Size=40K2024.06 | 63.9 |