Pluralistic Reward Model Learning on PRISM
59.6AccuracyEpiPersona
Evaluation Results
| Method | Links | |
|---|---|---|
| EpiPersonaBackbone=LLAMA-3.2-3B2026.03 | 59.6 | |
| EpiPersonaBackbone=LLAMA-3.1-8B2026.03 | 58.54 | |
| VPLBackbone=LLAMA-3.2-3B2026.03 | 58.26 | |
| VPLBackbone=LLAMA-3.1-8B2026.03 | 58.23 | |
| BTBackbone=LLAMA-3.1-8B2026.03 | 57.11 | |
| PALBackbone=LLAMA-3.2-3B2026.03 | 56.81 | |
| BTBackbone=LLAMA-3.2-3B2026.03 | 56.58 | |
| GPOBackbone=LLAMA-3.1-8B2026.03 | 56.48 | |
| GPOBackbone=LLAMA-3.2-3B2026.03 | 55.26 | |
| PALBackbone=LLAMA-3.1-8B2026.03 | 54.23 |