Personalized Reward Modeling on Chatbot Arena Personalized
75.92AccuracyP-GenRM
Evaluation Results
| Method | Links | |
|---|---|---|
| P-GenRMBase Model=Llama 3.1 8B, Scaling=Ind-16, Pro-82026.02 | 75.92 | |
| P-GenRMBase Model=Llama 3.1 8B, Scaling=Ind-8, Pro-42026.02 | 74.3 | |
| P-GenRMBase Model=Llama 3.1 70B, Scaling=None2026.02 | 73.42 | |
| P-GenRMBase Model=Llama 3.1 8B, Scaling=None2026.02 | 72.68 | |
| FT RM + SynthesizeMeBase Model=Llama 3.1 70B2026.02 | 72.05 | |
| Bradley-Terry Finetuned Reward ModelBase Model=Llama 3.1 70B2026.02 | 71.12 | |
| FT RM + SynthesizeMeBase Model=Llama 3.1 8B2026.02 | 69.78 | |
| Bradley-Terry Finetuned Reward ModelBase Model=Llama 3.1 8B2026.02 | 67.21 | |
| Persona-guided Scoring InductionBase Model=Llama 3.1 70B2026.02 | 65.55 | |
| In-Context LLM (+ SynthesizeMe)Base Model=Llama 3.1 70B2026.02 | 63.14 | |
| Persona-guided Scoring InductionBase Model=Llama 3.1 8B2026.02 | 62.2 | |
| P-CHECKBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 61.56 | |
| In-Context LLM (+ SynthesizeMe)Base Model=Llama 3.1 8B2026.02 | 61.07 | |
| PALBase Model=Llama 3.1 70B2026.02 | 59.4 | |
| VPLBase Model=Llama 3.1 70B2026.02 | 59.02 | |
| SynthMe JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 58.83 | |
| In-Context LLM (+ Preference History)Base Model=Llama 3.1 70B2026.02 | 58.65 | |
| In-Context LLM (+ Preference History)Base Model=Llama 3.1 8B2026.02 | 58.53 | |
| GPOBase Model=Llama 3.1 70B2026.02 | 58.5 | |
| Memory JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 58.15 | |
| VPLBase Model=Llama 3.1 8B2026.02 | 58.12 | |
| GPOBase Model=Llama 3.1 8B2026.02 | 57.87 | |
| In-Context LLM (+ CoT)Base Model=Llama 3.1 70B2026.02 | 57.61 | |
| PALBase Model=Llama 3.1 8B2026.02 | 57.31 | |
| In-Context LLM (+ CoT)Base Model=Llama 3.1 8B2026.02 | 57.05 | |
| In-Context LLM (Default)Base Model=Llama 3.1 70B2026.02 | 57.02 | |
| BT + SynthMeBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 56.42 | |
| In-Context LLM (Default)Base Model=Llama 3.1 8B2026.02 | 56.37 | |
| CoT distill JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.84 | |
| P-CHECKBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.03 | |
| PALBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 53.89 | |
| CoT distill JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 53.77 | |
| Default JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 53.56 | |
| VPLBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 53.36 | |
| BT + SynthMeBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 53.32 | |
| SynthMe JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 52.76 | |
| PALBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 52.41 | |
| VPLBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 52.34 | |
| Memory JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 52.29 | |
| Default JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 52.23 | |
| GPOBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 52.01 | |
| GPOBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 51.89 |