Model Evaluation on JudgeBench (test)
5.63KuiperProbe
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProbeModel=LLAMA Scout (109B)2025.12 | 5.63 | 7.66 | |
| ProbeModel=GPT-OSS 20B2025.12 | 6.01 | 12.63 | |
| MajorityModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | 7.38 | 9.97 | |
| ConsistencyModel=GPT-OSS 20B, N=10, temperature=0.72025.12 | 7.56 | 10.97 | |
| VerbalizedModel=GPT-OSS 20B2025.12 | 12.76 | 12.67 | |
| VerbalizedModel=LLAMA Scout (109B)2025.12 | 13.88 | 13.12 | |
| MajorityModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | 29.55 | 28.42 | |
| ConsistencyModel=LLAMA Scout (109B), N=10, temperature=0.72025.12 | 30.11 | 29.18 |