Process Reward Model Assessment on PROCESSBENCH
87.3GSM8K AccuracyQwen2.5-Math-PRM-72B
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2.5-Math-PRM-72BSupervision Type=step-labeled PRM, Model Scale=72B2026.04 | 87.3 | 80.6 | 74.3 | 71.1 | 78.3 | |
| FOVER-Qwen2.5-7B-PRMFine-tuned=true, Training Data=FOVER-40K2025.05 | 86.6 | 88 | 84 | 84.5 | 85.8 | |
| FOVER-Llama3.1-8B-PRMFine-tuned=true, Training Data=FOVER-40K2025.05 | 81.2 | 76.4 | 75.5 | 76.3 | 77.3 | |
| Qwen 2.5 7BFine-tuned=false2025.05 | 75.5 | 78.2 | 76.2 | 73.6 | 75.9 | |
| Llama3.1-8B-ImplicitPRM-DPOSupervision Type=outcome-only, Backbone Model=Llama3.1-8B, Training Objective=DPO2026.04 | 72.1 | 46 | 28 | 26.7 | 43.2 | |
| Skywork-PRM-7BModel=Skywork-PRM-7B2025.03 | 70.8 | 53.6 | 22.9 | 21 | 42.1 | |
| Llama 3.1 8BFine-tuned=false2025.05 | 70 | 67.4 | 68.3 | 63.9 | 67.4 | |
| TCRM-Llama3.1-8BSupervision Type=outcome-only, Training Data=math data, Backbone Model=Llama3.1-8B2026.04 | 68.9 | 47.7 | 34.8 | 28.3 | 44.9 | |
| Llama3.1-8B-ImplicitPRM-CESupervision Type=outcome-only, Backbone Model=Llama3.1-8B, Training Objective=CE2026.04 | 67.6 | 46.2 | 27.5 | 29.7 | 42.8 | |
| Skywork-PRM-1.5BModel=Skywork-PRM-1.5B2025.03 | 59 | 48 | 19.3 | 19.2 | 36.4 | |
| Qwen2.5-1.5B-Instruct-Epic50kModel=Qwen2.5-1.5B-Instruct-Epic50k2025.03 | 58.1 | 53.2 | 32.2 | 40.6 | 46 | |
| Qwen2-1.5B-Epic50kModel=Qwen2-1.5B-Epic50k2025.03 | 55.6 | 36.1 | 20.2 | 30 | 35.5 | |
| RLHFlow-PRM-Mistral-8BModel=RLHFlow-PRM-Mistral-8B2025.03 | 50.4 | 33.4 | 13.8 | 15.8 | 28.4 | |
| Qwen2.5-1.5B-Instruct-PRM800kModel=Qwen2.5-1.5B-Instruct-PRM800k2025.03 | 49.1 | 59.3 | 32.5 | 35.9 | 44.2 | |
| Qwen2-1.5B-MATH-ShepherdModel=Qwen2-1.5B-MATH-Shepherd2025.03 | 48.9 | 34.1 | 9.8 | 13.7 | 26.6 | |
| Math-Shepherd-PRM-7BModel=Math-Shepherd-PRM-7B2025.03 | 47.9 | 29.5 | 24.8 | 23.8 | 31.5 | |
| Qwen2.5-1.5B-Instruct-ShepherdModel=Qwen2.5-1.5B-Instruct-Shepherd2025.03 | 44.1 | 29.8 | 12.1 | 17.6 | 25.9 | |
| RLHFlow-PRM-Deepseek-8BModel=RLHFlow-PRM-Deepseek-8B2025.03 | 38.8 | 33.8 | 16.9 | 16.9 | 26.6 | |
| ABC-Llama3.1-8BSupervision Type=outcome-only, Backbone Model=Llama3.1-8B2026.04 | 38.5 | 29.3 | 16 | 15.1 | 24.7 | |
| Qwen2-1.5B-PRM800kModel=Qwen2-1.5B-PRM800k2025.03 | 34 | 55.3 | 34.2 | 41 | 41.1 |