Sibling-model judgment on MMLU-Pro
0.83AUROCGnosis-SelfJudge
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gnosis-SelfJudgeJudged Model=Qwen3 8B-Hybrid2025.12 | 0.83 | 0.94 | 0.07 | |
| Gnosis-Qwen1.7B as RMJudged Model=Qwen3 8B-Hybrid2025.12 | 0.83 | 0.94 | 0.15 | |
| Gnosis-SelfJudgeJudged Model=Qwen3 4B-Thinking2025.12 | 0.82 | 0.93 | 0.05 | |
| Gnosis-Qwen1.7B as RMJudged Model=Qwen3 4B-Thinking2025.12 | 0.81 | 0.93 | 0.16 | |
| Gnosis-SelfJudgeJudged Model=Qwen3 1.7B-Hybrid2025.12 | 0.8 | 0.9 | 0.11 | |
| SkyworkRM-Qwen3-8BJudged Model=Qwen3 1.7B-Hybrid2025.12 | 0.76 | 0.87 | 0.17 | |
| SkyworkRM-Qwen3-8BJudged Model=Qwen3 4B-Thinking2025.12 | 0.73 | 0.88 | 0.17 | |
| SkyworkRM-Qwen3-8BJudged Model=Qwen3 8B-Hybrid2025.12 | 0.73 | 0.89 | 0.19 |