Process Reward Modeling on PRMBENCH
81.7Simplicity Avg ScoreSkywork-PRM-7B
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Skywork-PRM-7B2026.04 | 81.7 | — | — | — | — | — | — | — | 56.6 | — | — | — | 90.1 | 89.2 | 40.9 | 65.1 | |
| DeepSeek-R1 (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 73.2 | 76.5 | 74.1 | 72.3 | 80.1 | 77.5 | 78.9 | 79.4 | 79 | 71 | 74.3 | 100 | 81.8 | — | — | — | |
| o1-mini (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 70.2 | 73.5 | 71.2 | 69.1 | 77.5 | 74.8 | 76.3 | 75.6 | 76.1 | 67.3 | 70.4 | 100 | 79.2 | — | — | — | |
| GPT-4o (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 67.6 | 72.3 | 66.1 | 69 | 75.9 | 73.2 | 74.7 | 76.4 | 75.1 | 66.8 | 70.9 | 100 | 79.2 | — | — | — | |
| DeepSeek-R1Paradigm=Prompted as Critic Model2025.07 | 65.6 | 69.5 | 66 | 65.2 | 74.8 | 70.1 | 72.2 | 72.9 | 72.5 | 63.2 | 66.2 | 100 | 76.5 | — | — | — | |
| o1-miniParadigm=Prompted as Critic Model, Evaluation=Subset of 394 samples2025.07 | 64.6 | 68.8 | 65.6 | 63.7 | 74.5 | 67.7 | 73.8 | 72.3 | 72.1 | 61.8 | 64.8 | 100 | 75.5 | — | — | — | |
| QwQ-Preview-32B (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 64.3 | 70 | 63.2 | 65.4 | 72.4 | 74.3 | 72.9 | 74.5 | 73.5 | 64.5 | 67.9 | 100 | 77.5 | — | — | — | |
| R1-Distill-Qwen-32B (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 63.4 | 69 | 62 | 64.7 | 71.1 | 72.6 | 71.3 | 73.8 | 72.2 | 63.6 | 66.8 | 100 | 76.8 | — | — | — | |
| R1-Distill-Qwen-7B (DG-PRM)Paradigm=Dynamic and Generalizable Process Reward Modeling2025.07 | 61.3 | 65.2 | 60.4 | 62.1 | 69.8 | 68.1 | 69.5 | 72.1 | 69.9 | 62.4 | 64.2 | 100 | 75.5 | — | — | — | |
| GPT-4oParadigm=Prompted as Critic Model, Source=Official Leaderboard2025.07 | 59.7 | 66.8 | 57 | 62.4 | 72 | 69.7 | 70.7 | 71.1 | 70.9 | 62.5 | 65.7 | 99.2 | 75.8 | — | — | — | |
| QwQ-Preview-32BParadigm=Prompted as Critic Model, Source=Official Leaderboard2025.07 | 56.4 | 63.6 | 57.2 | 55.6 | 67.4 | 72.3 | 66.2 | 66.9 | 68.2 | 57.8 | 62.7 | 100 | 73.5 | — | — | — | |
| Qwen2.5-Math-PRM-7B-PDDL-rtraining_data=PDDL-r2026.04 | 55.3 | — | — | — | — | — | — | — | 72.3 | — | — | — | 60.2 | 90.9 | 44.2 | 67.5 | |
| R1-Distill-Qwen-32BParadigm=Prompted as Critic Model, Source=Official Leaderboard2025.07 | 54.5 | 60.2 | 57.2 | 51.9 | 66.1 | 68.4 | 69.3 | 64.8 | 67.2 | 53.3 | 54.6 | 99.9 | 69.3 | — | — | — | |
| Qwen2.5-Math-7B-MathShepherd-PDDL-rtraining_data=MathShepherd-PDDL-r2026.04 | 52.3 | — | — | — | — | — | — | — | 63.8 | — | — | — | 56.5 | 86.8 | 35.3 | 61 | |
| Qwen2.5-Math-PRM-7B2026.04 | 52.1 | — | — | — | — | — | — | — | 71 | — | — | — | 75.5 | 91.5 | 39.4 | 65.5 | |
| Llemma-PRM800k-7BParadigm=Open-source Discriminative Process Reward Model, Source=Official Leaderboard2025.07 | 51.4 | 52 | 49.3 | 53.4 | 56.4 | 47.1 | 46.7 | 53.3 | 50.9 | 51 | 53.5 | 93.6 | 66 | — | — | — | |
| MATHMinos-Mistral-7BParadigm=Open-source Discriminative Process Reward Model, Source=Official Leaderboard2025.07 | 51.4 | 54.2 | 48.8 | 54 | 57 | 52.1 | 50.7 | 57.8 | 54.4 | 52.8 | 55.8 | 91.1 | 66.5 | — | — | — | |
| Qwen2.5-Math-7B-MathShepherd-rtraining_data=MathShepherd-r2026.04 | 48.5 | — | — | — | — | — | — | — | 55.1 | — | — | — | 51.9 | 81.5 | 26.5 | 54 | |
| RLHFlow-PRM-Deepseek-8BParadigm=Open-source Discriminative Process Reward Model, Source=Official Leaderboard2025.07 | 47.6 | 54.2 | 46.4 | 48.9 | 55.7 | 55 | 53.2 | 66.2 | 57.5 | 49 | 55.4 | 99.8 | 68.1 | — | — | — | |
| MathShepherd-Mistral-7BParadigm=Open-source Discriminative Process Reward Model, Source=Official Leaderboard2025.07 | 47.1 | 47 | 44 | 50.3 | 49.4 | 44.5 | 41.3 | 47.7 | 45.7 | 47.2 | 48.6 | 86.1 | 60.7 | — | — | — | |
| RLHFlow-PRM-Mistral-8BParadigm=Open-source Discriminative Process Reward Model, Source=Official Leaderboard2025.07 | 46.7 | 54.4 | 46.1 | 47.3 | 56.6 | 55.1 | 54.4 | 63.8 | 57.5 | 51.5 | 56.2 | 97.9 | 68.5 | — | — | — | |
| R1-Distill-Qwen-7BParadigm=Prompted as Critic Model, Source=Official Leaderboard2025.07 | 35.4 | 52.6 | 32.9 | 37.9 | 47.3 | 54.1 | 48.4 | 48 | 49.4 | 45.6 | 46.8 | 100 | 64.1 | — | — | — |