Reward Modeling on HHH-Alignment OOD (test)
78.7ScoreGRM w/ sft
Evaluation Results
| Method | Links | |
|---|---|---|
| GRM w/ sftBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 78.7 | |
| GRM w/ dpo-norefBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 76.6 | |
| Classifier + EnsembleBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 72.2 | |
| GRM w/ dpoBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 71.6 | |
| Classifier (baseline)Base Model=gemma-2B-it, Training Data Size=40K2024.06 | 70.3 | |
| Classifier + marginBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 69.8 | |
| Classifier + label smoothBase Model=gemma-2B-it, Training Data Size=40K2024.06 | 68.8 | |
| Classifier (Frozen)Base Model=gemma-2B-it, Training Data Size=40K2024.06 | 68.6 |