Reward Modeling on PersonalRewardBench (test)
65.21Macro AccuracyP-GenRM-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| P-GenRM-8Bparameter count=8B2026.02 | 65.21 | |
| o32026.02 | 63.33 | |
| SynthesizeMe 70Bparameter count=70B2026.02 | 61.51 | |
| Fine-tuned BT-70Bparameter count=70B, training strategy=fine-tuned2026.02 | 60.64 | |
| Llama3.1-70Bparameter count=70B2026.02 | 58.27 | |
| Llama3.1-8Bparameter count=8B2026.02 | 56.24 |