Step-level reasoning evaluation on PDDL (test)
94.5F1 ScoreLlama-3.1-8B-PRM800k-PDDL-r
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Llama-3.1-8B-PRM800k-PDDL-rModel=Llama-3.1-8B-PRM800k-PDDL-r2026.04 | 94.5 | 99.2 | 90.1 | |
| Qwen2.5-Math-PRM-7B-PDDL-rModel=Qwen2.5-Math-PRM-7B-PDDL-r2026.04 | 92.1 | 99.1 | 86 | |
| Qwen2.5-Math-PRM-7B-PDDL-rModel=Qwen2.5-Math-PRM-7B-PDDL-r2026.04 | 91.2 | — | — | |
| Qwen2.5-Math-7B-PRM800k-PDDL-rModel=Qwen2.5-Math-7B-PRM800k-PDDL-r2026.04 | 90.8 | 99.2 | 83.7 | |
| Qwen2.5-Math-7B-MathShepherd-PDDL-rModel=Qwen2.5-Math-7B-MathShepherd-PDDL-r2026.04 | 89.5 | — | — | |
| Qwen2.5-Math-7B-MathShepherd-PDDL-rModel=Qwen2.5-Math-7B-MathShepherd-PDDL-r2026.04 | 89.3 | 96.8 | 83 | |
| Llama-3.1-8B-PRM800k-PDDL-rModel=Llama-3.1-8B-PRM800k-PDDL-r2026.04 | 86.8 | — | — | |
| Qwen2.5-Math-7B-PRM800k-PDDL-rModel=Qwen2.5-Math-7B-PRM800k-PDDL-r2026.04 | 85.8 | — | — | |
| Llama-3.1-8B-PRM800k-rModel=Llama-3.1-8B-PRM800k-r2026.04 | 57 | — | — | |
| Qwen2.5-Math-7B-PRM800k-rModel=Qwen2.5-Math-7B-PRM800k-r2026.04 | 54.6 | 39.7 | 87.5 | |
| Llama-3.1-8B-PRM800k-rModel=Llama-3.1-8B-PRM800k-r2026.04 | 50.2 | 49.4 | 51.1 | |
| Qwen2.5-Math-PRM-7BModel=Qwen2.5-Math-PRM-7B2026.04 | 44 | 32.5 | 68.2 | |
| Qwen2.5-Math-7B-PRM800k-rModel=Qwen2.5-Math-7B-PRM800k-r2026.04 | 40.2 | — | — | |
| Qwen2.5-Math-PRM-7BModel=Qwen2.5-Math-PRM-7B2026.04 | 30.7 | — | — | |
| Qwen2.5-Math-7B-MathShepherd-rModel=Qwen2.5-Math-7B-MathShepherd-r2026.04 | 2.9 | 14.9 | 1.6 | |
| Qwen2.5-Math-7B-PRM800kModel=Qwen2.5-Math-7B-PRM800k2026.04 | 1.6 | 0.8 | 100 | |
| Qwen2.5-Math-7B-MathShepherd-rModel=Qwen2.5-Math-7B-MathShepherd-r2026.04 | 1.5 | — | — | |
| Qwen2.5-Math-7B-PRM800kModel=Qwen2.5-Math-7B-PRM800k2026.04 | 0.8 | — | — | |
| Skywork-PRM-7BModel=Skywork-PRM-7B2026.04 | 0 | 12.9 | 0 | |
| Skywork-PRM-7BModel=Skywork-PRM-7B2026.04 | 0 | — | — |