Step-level Reasoning Verification on ProofNet
68.2PR-AUCReProbe, Hidden States, GPT-OSS-anno
Evaluation Results
| Method | Links | |
|---|---|---|
| ReProbe, Hidden States, GPT-OSS-anno# Sample=10.8K, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 68.2 | |
| Qwen2.5-Math-PRM-7B# Sample=860K, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 64.6 | |
| Universal-PRM-Qwen2.5-Math-7B# Sample=690K, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 56.8 | |
| Qwen2.5-Math-7B-PRM800K# Sample=263K, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 45.4 | |
| Skywork-PRM-1.5B# Sample=Unk, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 28.9 | |
| Universal-PRM-Qwen2.5-Math-7B# Sample=690K2025.11 | 26.3 | |
| Qwen2.5-Math-7B# Sample=860K2025.11 | 24 | |
| Qwen2.5-Math-7B-PRM800k# Sample=265K2025.11 | 23.8 | |
| Math-Shepherd-PRM-7B# Sample=440K2025.11 | 18.8 | |
| Skywork-PRM-1.5B# Sample=Unk2025.11 | 18.5 | |
| ReProbe, Attn+Logit, Qwen3-8B-anno# Sample=32K2025.11 | 15.5 | |
| H4-Qwen2.5-PRM-1.5B-0.2# Sample=369K, Verifying Model=Qwen3-32B, Thinking Mode=native2025.11 | 14.9 | |
| MaxProb# Sample=-2025.11 | 12.3 | |
| RLHFlow-PRM-Deepseek-8B# Sample=253K2025.11 | 10.9 | |
| MaxEntropy# Sample=-2025.11 | 10.7 | |
| H4-Qwen2.5-PRM-1.5B-0.2# Sample=369K2025.11 | 10.5 | |
| Perplexity# Sample=-2025.11 | 9.9 | |
| RLHFlow-PRM-Mistral-8B# Sample=273K2025.11 | 9.3 | |
| Random# Sample=-2025.11 | 8.2 |