Reasoning Correctness Evaluation on AIME 1983–2024
0Average False Positive RateMaster-RM 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Master-RM 7BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Master-RM 32BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Multi-sub RMResponse=Average | Worst2025.07 | 0 | — | 0 | |
| GPT-o1Response=Average | Worst2025.07 | 0.4 | — | 1.4 | |
| GPT-4oResponse=Average | Worst2025.07 | 3.6 | — | 15.3 | |
| Omni-JudgeResponse=Average | Worst2025.07 | 3.7 | — | 13.9 | |
| Qwen2.5-7BResponse=Average | Worst2025.07 | 3.9 | — | 8.6 | |
| General-VerifierResponse=Average | Worst2025.07 | 14.7 | — | 87 | |
| Claude-3.5Response=Average | Worst2025.07 | 28.2 | — | 56.2 | |
| Qwen2.5-72BResponse=Average | Worst2025.07 | 54 | — | 90.9 | |
| LLaMA3-8BResponse=Average | Worst2025.07 | 82 | — | 92 | |
| LLaMA3-70BResponse=Average | Worst2025.07 | 89.1 | — | 95.1 |