Step-level reasoning evaluation on Rooms (test)
0Error RateQwen2.5-Math-7B-PRM800k
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-Math-7B-PRM800kModel=Qwen2.5-Math-7B-PRM800k2026.04 | 0 | 100 | 0 | |
| Qwen2.5-Math-PRM-7BModel=Qwen2.5-Math-PRM-7B2026.04 | 9.5 | 100 | 17.3 | |
| Skywork-PRM-7BModel=Skywork-PRM-7B2026.04 | 14.7 | 0 | 0 | |
| Qwen2.5-Math-7B-MathShepherd-rModel=Qwen2.5-Math-7B-MathShepherd-r2026.04 | 14.7 | 0 | 0 | |
| Qwen2.5-Math-7B-PRM800k-rModel=Qwen2.5-Math-7B-PRM800k-r2026.04 | 14.8 | 100 | 25.7 | |
| Llama-3.1-8B-PRM800k-rModel=Llama-3.1-8B-PRM800k-r2026.04 | 46.9 | 99.5 | 63.7 | |
| Qwen2.5-Math-7B-PRM800k-PDDL-rModel=Qwen2.5-Math-7B-PRM800k-PDDL-r2026.04 | 75.4 | 86.8 | 80.7 | |
| Llama-3.1-8B-PRM800k-PDDL-rModel=Llama-3.1-8B-PRM800k-PDDL-r2026.04 | 75.7 | 82.9 | 79.1 | |
| Qwen2.5-Math-7B-MathShepherd-PDDL-rModel=Qwen2.5-Math-7B-MathShepherd-PDDL-r2026.04 | 81.3 | 99.9 | 89.6 | |
| Qwen2.5-Math-PRM-7B-PDDL-rModel=Qwen2.5-Math-PRM-7B-PDDL-r2026.04 | 83.1 | 98.9 | 90.3 |