Instruction Following on Alpaca-V2 Arena-Hard
9.2Alpaca V2 ScoreMix-GRM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mix-GRMTraining Protocol=DPO Training, Reward Model=Mix-GRM2026.03 | 9.2 | 15 | 12.1 | |
| FARE-8BTraining Protocol=DPO Training, Reward Model=FARE-8B2026.03 | 8.9 | 15.1 | 12 | |
| RubricRM-8BTraining Protocol=DPO Training, Reward Model=RubricRM-8B2026.03 | 8.5 | 12.5 | 10.5 | |
| DeepSeek-GRM-16BTraining Protocol=DPO Training, Reward Model=DeepSeek-GRM-16B2026.03 | 8 | 14.1 | 11.1 | |
| RM-R1-InstructTraining Protocol=DPO Training, Reward Model=RM-R1-Instruct2026.03 | 7.9 | 14.3 | 11.1 | |
| SFTTraining Protocol=SFT2026.03 | 6.4 | 4.2 | 5.3 |