Personalized Reward Modeling on PRISM Personalized
68.06AccuracyP-GenRM
Evaluation Results
| Method | Links | |
|---|---|---|
| P-GenRMBase Model=Llama 3.1 8B, Scaling=Ind-16, Pro-82026.02 | 68.06 | |
| P-GenRMBase Model=Llama 3.1 8B, Scaling=Ind-8, Pro-42026.02 | 67.54 | |
| P-GenRMBase Model=Llama 3.1 70B, Scaling=None2026.02 | 66.21 | |
| P-GenRMBase Model=Llama 3.1 8B, Scaling=None2026.02 | 65.32 | |
| P-CHECKBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 65.11 | |
| FT RM + SynthesizeMeBase Model=Llama 3.1 70B2026.02 | 63.74 | |
| Bradley-Terry Finetuned Reward ModelBase Model=Llama 3.1 70B2026.02 | 63.44 | |
| Bradley-Terry Finetuned Reward ModelBase Model=Llama 3.1 8B2026.02 | 63.27 | |
| FT RM + SynthesizeMeBase Model=Llama 3.1 8B2026.02 | 62.84 | |
| BT + SynthMeBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 62.74 | |
| Persona-guided Scoring InductionBase Model=Llama 3.1 70B2026.02 | 61.61 | |
| BT + SynthMeBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 61.39 | |
| P-CHECKBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 60.91 | |
| VPLBase Model=Llama 3.1 70B2026.02 | 59.7 | |
| GPOBase Model=Llama 3.1 70B2026.02 | 59.16 | |
| Persona-guided Scoring InductionBase Model=Llama 3.1 8B2026.02 | 58.33 | |
| VPLBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 58.26 | |
| VPLBase Model=Llama 3.1 8B2026.02 | 58.25 | |
| VPLBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 58.23 | |
| In-Context LLM (+ SynthesizeMe)Base Model=Llama 3.1 70B2026.02 | 58.19 | |
| PALBase Model=Llama 3.1 70B2026.02 | 57.75 | |
| GPOBase Model=Llama 3.1 8B2026.02 | 57.29 | |
| In-Context LLM (+ Preference History)Base Model=Llama 3.1 70B2026.02 | 57.11 | |
| PALBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 56.81 | |
| PALBase Model=Llama 3.1 8B2026.02 | 56.74 | |
| GPOBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 56.48 | |
| In-Context LLM (+ Preference History)Base Model=Llama 3.1 8B2026.02 | 56.24 | |
| CoT distill JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.47 | |
| GPOBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 55.26 | |
| SynthMe JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.24 | |
| In-Context LLM (+ SynthesizeMe)Base Model=Llama 3.1 8B2026.02 | 54.7 | |
| PALBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 54.23 | |
| In-Context LLM (+ Demographics)Base Model=Llama 3.1 70B2026.02 | 54.21 | |
| Memory JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 54.17 | |
| In-Context LLM (+ CoT)Base Model=Llama 3.1 70B2026.02 | 54.09 | |
| In-Context LLM (Default)Base Model=Llama 3.1 70B2026.02 | 54.02 | |
| CoT distill JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 53.36 | |
| In-Context LLM (+ Demographics)Base Model=Llama 3.1 8B2026.02 | 52.96 | |
| Default JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 52.8 | |
| In-Context LLM (+ CoT)Base Model=Llama 3.1 8B2026.02 | 52.58 | |
| SynthMe JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 52.09 | |
| In-Context LLM (Default)Base Model=Llama 3.1 8B2026.02 | 52.04 | |
| Default JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 51.65 | |
| Memory JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 50.86 |