Pluralistic Reward Model Learning on ARENA
60.56Accuracy (ARENA)PAL
Evaluation Results
| Method | Links | |
|---|---|---|
| PALBackbone=LLAMA-3.2-3B2026.03 | 60.56 | |
| EpiPersonaBackbone=LLAMA-3.2-3B2026.03 | 59.57 | |
| EpiPersonaBackbone=LLAMA-3.1-8B2026.03 | 57.45 | |
| GPOBackbone=LLAMA-3.1-8B2026.03 | 56.69 | |
| VPLBackbone=LLAMA-3.2-3B2026.03 | 56.69 | |
| PALBackbone=LLAMA-3.1-8B2026.03 | 56.69 | |
| VPLBackbone=LLAMA-3.1-8B2026.03 | 54.93 | |
| BTBackbone=LLAMA-3.1-8B2026.03 | 54.06 | |
| GPOBackbone=LLAMA-3.2-3B2026.03 | 53.87 | |
| BTBackbone=LLAMA-3.2-3B2026.03 | 51.94 |