Reward Modeling on PandaLM (test)
79.42AccuracyOPENREWARD
Evaluation Results
| Method | Links | |
|---|---|---|
| OPENREWARDBackbone=Qwen-2.5-7B-Instruct, Training Data Size=27K2025.10 | 79.42 | |
| RRM-7BBackbone=Qwen-2.5-7B-Instruct, Training Data Size=420K2025.10 | 77.74 | |
| Prometheus-v2.0Backbone=Mistral-7B-Instruct, Training Data Size=200K2025.10 | 72.8 | |
| RM-R1Backbone=Qwen-2.5-7B-Instruct, Training Data Size=72K2025.10 | 72.71 | |
| JudgeLRM-7BBackbone=Qwen-2.5-7B-Instruct, Training Data Size=100K2025.10 | 72.37 |