Reasoning Evaluation on MR-Ben
56.1Math F1Qwen2.5-Math-PRM-7B-PDDL-r
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-Math-PRM-7B-PDDL-rBackbone=Qwen2.5-Math-7B, Learning Objective=Regression, Augmentation=PDDL2026.04 | 56.1 | 29.6 | 36.2 | 26.7 | 42.7 | 24 | 35.9 | 31.8 | |
| Qwen2.5-Math-PRM-7BBackbone=Qwen2.5-Math-7B, Learning Objective=Classification2026.04 | 55.5 | 22.8 | 36.4 | 23.5 | 39.5 | 19 | 32.8 | 28.2 | |
| Qwen2.5-Math-7B-PRM800k-PDDL-rBackbone=Qwen2.5-Math-7B, Training Data=PRM800k, Augmentation=PDDL, Learning Objective=Regression2026.04 | 53.6 | 27.1 | 45 | 30 | 37.6 | 27.6 | 36.8 | 33.5 | |
| Qwen2.5-Math-7B-PRM800kBackbone=Qwen2.5-Math-7B, Training Data=PRM800k, Learning Objective=Classification2026.04 | 47.7 | 17.7 | 28.7 | 18.8 | 33.2 | 8.8 | 25.8 | 21.4 | |
| Qwen2.5-Math-7B-PRM800k-rBackbone=Qwen2.5-Math-7B, Training Data=PRM800k, Learning Objective=Regression2026.04 | 47.5 | 21.9 | 40 | 23.9 | 29.7 | 22.4 | 30.9 | 27.6 | |
| Llama-3.1-8B-PRM800k-PDDL-rBackbone=Llama-3.1-8B, Training Data=PRM800k, Augmentation=PDDL, Learning Objective=Regression2026.04 | 44.4 | 36.6 | 42.1 | 35.5 | 36.4 | 28.1 | 37.2 | 35.7 | |
| Qwen2.5-Math-7B-MathShepherd-PDDL-rBackbone=Qwen2.5-Math-7B, Training Data=MathShepherd, Augmentation=PDDL, Learning Objective=Regression2026.04 | 43.2 | 13.3 | 33.6 | 9 | 20.6 | 15.6 | 22.5 | 18.4 | |
| Llama-3.1-8B-PRM800k-rBackbone=Llama-3.1-8B, Training Data=PRM800k, Learning Objective=Regression2026.04 | 39.3 | 25 | 30.7 | 24 | 27.3 | 22.4 | 28.1 | 25.9 | |
| Qwen2.5-Math-7B-MathShepherd-rBackbone=Qwen2.5-Math-7B, Training Data=MathShepherd, Learning Objective=Regression2026.04 | 25.8 | 2.8 | 8.3 | 2.1 | 9.4 | 0.6 | 8.2 | 4.6 | |
| Skywork-PRM-7BBackbone=Skywork-7B2026.04 | 21 | 27.1 | 23.1 | 10.2 | 27.1 | 13.1 | 20.3 | 20.1 |