Step-level reasoning evaluation on PRMBench step-level 2025
47.13FPRPRISM
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| PRISMLoss function=Pairwise Loss, Data augmentation=true, Curriculum learning=true2026.06 | 47.13 | 12.69 | 91.93 | 87.3 | 52.86 | 68 | 32.22 | |
| Qwen-PRM-7B + Pairwise Loss (12k data) + CLLoss function=Pairwise Loss, Training data size=12k, Curriculum Learning=true2026.06 | 60.58 | 7.2 | 90.4 | 92.79 | 39.42 | 67.3 | 12.63 | |
| Qwen-PRM-7B + Pairwise Loss (12k data)Loss function=Pairwise Loss, Training data size=12k2026.06 | 61.13 | 7.1 | 88.96 | 92.41 | 38.86 | 67 | 11.84 | |
| Qwen-PRM-7B + Pointwise Loss + Data Aug. (132k)Loss function=Pointwise Loss, Training data size=132k, Data augmentation=true2026.06 | 67 | 6 | 89.6 | 94 | 33.5 | 65.6 | 3.37 | |
| Qwen-PRM-7B (Baseline)Backbone=Qwen-PRM-7B2026.06 | 69.34 | 4.27 | 89.4 | 95.36 | 30.66 | 65.5 | 0 |