Overall Language Model Evaluation on Aggregated Benchmarks STEM Code IF General
61.7Average ScoreGenRM-R-Align-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| GenRM-R-Align-14BReward Model=GenRM-R-Align-14B2026.02 | 61.7 | |
| GenRM-R-Align-8BReward Model=GenRM-R-Align-8B2026.02 | 59.7 | |
| GenRM-RLVR-14BReward Model=GenRM-RLVR-14B2026.02 | 59.4 | |
| Qwen3-14B-as-GenRMReward Model=Qwen3-14B-as-GenRM2026.02 | 59.1 | |
| Qwen3-8B-as-GenRMReward Model=Qwen3-8B-as-GenRM2026.02 | 58.1 | |
| GenRM-RLVR-8BReward Model=GenRM-RLVR-8B2026.02 | 57.6 | |
| Qwen3-8BReward Model=Baseline2026.02 | 53.9 |