Personalized Reward Modeling on Lamp-QA (OOD)
60Arts ScoreQwen3-235B-A22B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Qwen3-235B-A22BModel Size=235B-A22B2026.02 | 60 | 65.7 | 60 | 61.9 | |
| Qwen3-32BModel Size=32B2026.02 | 54.3 | 60 | 54.3 | 56.2 | |
| LLaMA3.1-70BModel Size=70B2026.02 | 54.3 | 65.7 | 60 | 60 | |
| P-GenRMModel Size=8B, Inference Scaling=Ind-8, Pro-4, Setting=Cold-start2026.02 | 54.3 | 71.4 | 65.7 | 63.8 | |
| Qwen3-8BModel Size=8B2026.02 | 48.6 | 54.3 | 60 | 54.3 | |
| LLaMA3.1-8BModel Size=8B2026.02 | 48.6 | 54.3 | 54.3 | 52.4 | |
| SynthMe-8BModel Size=8B2026.02 | 48.6 | 65.7 | 60 | 58.1 |