Reasoning Correctness Evaluation on RLVR Multi-subject
0Average FPR (%)Master-RM 7B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Master-RM 7BResponse=Average | Worst2025.07 | 0 | — | 0 | |
| Master-RM 32BResponse=Average | Worst2025.07 | 0.1 | — | 0.2 | |
| Multi-sub RMResponse=Average | Worst2025.07 | 0.1 | — | 0.5 | |
| Claude-3.5Response=Average | Worst2025.07 | 0.7 | — | 4.1 | |
| GPT-o1Response=Average | Worst2025.07 | 0.9 | — | 3.4 | |
| General-VerifierResponse=Average | Worst2025.07 | 4.6 | — | 26.7 | |
| Qwen2.5-7BResponse=Average | Worst2025.07 | 9 | — | 15.7 | |
| GPT-4oResponse=Average | Worst2025.07 | 10.4 | — | 28.9 | |
| Omni-JudgeResponse=Average | Worst2025.07 | 19.6 | — | 54.1 | |
| Qwen2.5-72BResponse=Average | Worst2025.07 | 51.4 | — | 70.5 | |
| LLaMA3-8BResponse=Average | Worst2025.07 | 55 | — | 73.8 | |
| LLaMA3-70BResponse=Average | Worst2025.07 | 66.2 | — | 79.7 | |
| Master-RM 7BResponse=" "2025.07 | — | 0 | — | |
| Master-RM 7BResponse=.2025.07 | — | 0 | — | |
| Master-RM 7BResponse=,2025.07 | — | 0 | — | |
| Master-RM 7BResponse=:2025.07 | — | 0 | — | |
| Master-RM 7BResponse=Thought process:2025.07 | — | 0 | — | |
| Master-RM 7BResponse=Let’s solve this problem step by step.2025.07 | — | 0 | — | |
| Master-RM 7BResponse=Solution2025.07 | — | 0 | — | |
| Master-RM 7BResponse=解2025.07 | — | 0 | — | |
| Master-RM 7BResponse=かいせつ2025.07 | — | 0 | — | |
| Master-RM 7BResponse=Respuesta2025.07 | — | 0 | — |