Personalized Reward Modeling on Reddit TLDR 150 examples Unseen
69.8User-level AccuracyMRM
Evaluation Results
| Method | Links | |
|---|---|---|
| MRMBase Reward Model=Skywork-Reward V22026.01 | 69.8 | |
| MRMBase Reward Model=Skywork-Reward V12026.01 | 69.5 | |
| LoRe2026.01 | 68.8 | |
| GPO2026.01 | 68.6 | |
| BT2026.01 | 68.2 | |
| SynthesizeMeAdaptation Protocol=FT2026.01 | 68 | |
| VPL2026.01 | 67.9 | |
| PAL2026.01 | 66.7 | |
| SynthesizeMeAdaptation Protocol=ICL2026.01 | 66.3 | |
| Skywork-Reward V2Base Reward Model=V22026.01 | 64.5 | |
| Skywork-Reward V1Base Reward Model=V12026.01 | 62.6 |