Mathematical Reasoning on GSM8K, MATH, STEM, and TABMWP
77.6GSM8K AccuracyMix-GRM
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Mix-GRMTraining Protocol=DPO Training, Reward Model=Mix-GRM2026.03 | 77.6 | 27.1 | 39 | 41.9 | 46.4 | |
| RM-R1-InstructTraining Protocol=DPO Training, Reward Model=RM-R1-Instruct2026.03 | 76.3 | 26.5 | 38.5 | 41.7 | 45.8 | |
| RubricRM-8BTraining Protocol=DPO Training, Reward Model=RubricRM-8B2026.03 | 76 | 26.9 | 41.4 | 38.8 | 45.9 | |
| FARE-8BTraining Protocol=DPO Training, Reward Model=FARE-8B2026.03 | 75.7 | 26.9 | 39 | 41.4 | 45.8 | |
| DeepSeek-GRM-16BTraining Protocol=DPO Training, Reward Model=DeepSeek-GRM-16B2026.03 | 75.6 | 26.6 | 38.7 | 41.6 | 45.6 | |
| SFTTraining Protocol=SFT2026.03 | 75.1 | 25.2 | 38.6 | 40.9 | 45 |