Reward Modeling on Unified-Feedback (ID)
73.9AccuracyGRM w/ dpo-noref
Evaluation Results
| Method | Links | |
|---|---|---|
| GRM w/ dpo-norefTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 73.9 | |
| GRM w/ dpoTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 73.8 | |
| GRM w/ sftTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 73.2 | |
| Classifier + EnsembleTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 72.8 | |
| Classifier (baseline)Training Data Size=400K, Base Model=gemma-2B-it2024.06 | 72.1 | |
| Classifier + marginTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 72 | |
| Classifier + label smoothTraining Data Size=400K, Base Model=gemma-2B-it2024.06 | 71.5 | |
| Classifier (Frozen)Training Data Size=400K, Base Model=gemma-2B-it2024.06 | 63.8 |