Personalized Reward Modeling on BESPOKE-Meta OOD
75.48Binary Preference AccuracyP-CHECK
Evaluation Results
| Method | Links | |
|---|---|---|
| P-CHECKBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 75.48 | |
| P-CHECKBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 62.43 | |
| CoT distill JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 61.35 | |
| Memory JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 57.75 | |
| Default JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.46 | |
| CoT distill JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 55.23 | |
| SynthMe JudgeBackbone=Llama3-8b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 54.67 | |
| Memory JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 54.23 | |
| VPLBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 53.54 | |
| Default JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 53.45 | |
| VPLBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 52.89 | |
| GPOBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 52.04 | |
| GPOBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 51.49 | |
| PALBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 51.49 | |
| SynthMe JudgeBackbone=Llama3-3b, Evaluation Protocol=In context LLM-as-a-Judge2026.01 | 51.35 | |
| PALBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 51.33 | |
| BT + SynthMeBackbone=Llama3-3b, Evaluation Protocol=Finetuned Reward Model2026.01 | 50.83 | |
| BT + SynthMeBackbone=Llama3-8b, Evaluation Protocol=Finetuned Reward Model2026.01 | 50.47 |