Reasoning Correctness Evaluation on Naturalreasoning
0.7Average FPRMaster-RM 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Master-RM 7BResponse=Average | Worst2025.07 | 0.7 | — | 2.9 | |
| Claude-3.5Response=Average | Worst2025.07 | 2.6 | — | 11.3 | |
| Master-RM 32BResponse=Average | Worst2025.07 | 3.6 | — | 5.4 | |
| GPT-o1Response=Average | Worst2025.07 | 4.8 | — | 13.6 | |
| Multi-sub RMResponse=Average | Worst2025.07 | 5.2 | — | 11.5 | |
| General-VerifierResponse=Average | Worst2025.07 | 6.1 | — | 28.6 | |
| Qwen2.5-7BResponse=Average | Worst2025.07 | 15.2 | — | 23.2 | |
| Omni-JudgeResponse=Average | Worst2025.07 | 16.1 | — | 37.6 | |
| GPT-4oResponse=Average | Worst2025.07 | 20.2 | — | 40.6 | |
| Qwen2.5-72BResponse=Average | Worst2025.07 | 62.3 | — | 72.8 | |
| LLaMA3-70BResponse=Average | Worst2025.07 | 76.6 | — | 82.9 | |
| LLaMA3-8BResponse=Average | Worst2025.07 | 83 | — | 86.7 |