Reasoning Correctness Evaluation on MATH
0Average FPRMaster-RM 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Master-RM 7BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Master-RM 32BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Multi-sub RMResponse=Average | Worst2025.07 | 0.1 | — | 0.3 | |
| GPT-o1Response=Average | Worst2025.07 | 6.3 | — | 15.2 | |
| General-VerifierResponse=Average | Worst2025.07 | 13.8 | — | 66.8 | |
| GPT-4oResponse=Average | Worst2025.07 | 17.5 | — | 42.6 | |
| Qwen2.5-7BResponse=Average | Worst2025.07 | 22.1 | — | 31 | |
| Omni-JudgeResponse=Average | Worst2025.07 | 23.4 | — | 49.4 | |
| Claude-3.5Response=Average | Worst2025.07 | 25.6 | — | 57.7 | |
| Qwen2.5-72BResponse=Average | Worst2025.07 | 78.7 | — | 88.6 | |
| LLaMA3-8BResponse=Average | Worst2025.07 | 85.6 | — | 91.2 | |
| LLaMA3-70BResponse=Average | Worst2025.07 | 87.7 | — | 92.4 |