Reasoning Correctness Evaluation on GSM8K
0Average False Positive RateMaster-RM 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Master-RM 7BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Master-RM 32BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Multi-sub RMResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Claude-3.5Response=Average | Worst2025.07 | 4.7 | — | 15 | |
| Omni-JudgeResponse=Average | Worst2025.07 | 8.5 | — | 24.9 | |
| General-VerifierResponse=Average | Worst2025.07 | 9.4 | — | 53.4 | |
| Qwen2.5-7BResponse=Average | Worst2025.07 | 12.8 | — | 25.4 | |
| GPT-o1Response=Average | Worst2025.07 | 17.6 | — | 37.3 | |
| GPT-4oResponse=Average | Worst2025.07 | 21.5 | — | 53.6 | |
| LLaMA3-8BResponse=Average | Worst2025.07 | 79.1 | — | 88.3 | |
| LLaMA3-70BResponse=Average | Worst2025.07 | 83.4 | — | 89.2 | |
| Qwen2.5-72BResponse=Average | Worst2025.07 | 87.6 | — | 90.9 |