Process Reward Modeling on ProcessBench 1.0 (test)
87.3GSM8K ScoreQwen2.5-Math-PRM-72B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-Math-PRM-72Btraining_labels=step-wise, backbone=Qwen2.5-72B2026.04 | 87.3 | 80.6 | 74.3 | 71.1 | 78.3 | |
| Qwen2.5-Math-PRM-7Btraining_labels=step-wise, backbone=Qwen2.5-7B2026.04 | 82.4 | 77.6 | 67.5 | 66.3 | 73.5 | |
| Llama3.1-8B-ImplicitPRM-DPOtraining_labels=outcome, backbone=Llama3.1-8B, optimization=DPO2026.04 | 72.1 | 46 | 28 | 26.7 | 43.2 | |
| Skywork-PRM-7Btraining_labels=step-wise, backbone=7B2026.04 | 70.8 | 53.6 | 22.9 | 21 | 42.1 | |
| TCRM-Llama3.1-8B (trained on math data)training_labels=outcome, backbone=Llama3.1-8B, training_data=math data2026.04 | 68.9 | 47.7 | 34.8 | 28.3 | 44.9 | |
| Qwen2.5-Math-7B-PRM800Ktraining_labels=step-wise, backbone=Qwen2.5-7B2026.04 | 68.2 | 62.6 | 50.7 | 44.3 | 56.5 | |
| Llama3.1-8B-ImplicitPRM-CEtraining_labels=outcome, backbone=Llama3.1-8B, optimization=CE2026.04 | 67.6 | 46.2 | 27.5 | 29.7 | 42.8 | |
| Skywork-PRM-1.5Btraining_labels=step-wise, backbone=1.5B2026.04 | 59 | 48 | 19.3 | 19.2 | 36.4 | |
| Llama3.1-8B-ImplicitPRM-DPO (ref-free)training_labels=outcome, backbone=Llama3.1-8B, optimization=DPO, ref-free=true2026.04 | 57.7 | 42.6 | 34.1 | 36.7 | 42.8 | |
| Llama3.1-8B-ImplicitPRM-CE (ref-free)training_labels=outcome, backbone=Llama3.1-8B, optimization=CE, ref-free=true2026.04 | 51.2 | 39.3 | 32.2 | 33.6 | 39.1 | |
| RLHFlow-Llama3.1-8B-PRM-Mistraltraining_labels=step-wise, backbone=Llama3.1-8B2026.04 | 50.4 | 33.4 | 13.8 | 15.8 | 28.4 | |
| RLHFlow-Llama3.1-8B-PRM-Deepseektraining_labels=step-wise, backbone=Llama3.1-8B2026.04 | 38.8 | 33.8 | 16.9 | 16.9 | 26.6 | |
| ABC-Llama3.1-8Btraining_labels=outcome, backbone=Llama3.1-8B2026.04 | 38.5 | 29.3 | 16 | 15.1 | 24.7 | |
| TCRM-Llama3.1-8B (trained on Skywork data)training_labels=outcome, backbone=Llama3.1-8B, training_data=Skywork data2026.04 | 30.1 | 24.6 | 21.3 | 18 | 23.7 |