Groundedness on HaluEval
0.78Kendall's TauGPT-OSS-120B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-OSS-120BJudge Model=GPT-OSS-120B2025.12 | 0.78 | 0.03 | |
| Jury-on-Demand2025.12 | 0.77 | 0.02 | |
| GPT-OSS-20BJudge Model=GPT-OSS-20B2025.12 | 0.76 | 0.03 | |
| Gemini 2.5 FlashJudge Model=Gemini 2.5 Flash2025.12 | 0.74 | 0.04 | |
| Gemini 2.5 ProJudge Model=Gemini 2.5 Pro2025.12 | 0.73 | 0.03 | |
| Claude 3.7Judge Model=Claude 3.72025.12 | 0.67 | 0.04 | |
| Gemini 2.0 FlashJudge Model=Gemini 2.0 Flash2025.12 | 0.52 | 0.03 | |
| DeepSeek R1Judge Model=DeepSeek R12025.12 | 0.4 | 0.03 | |
| LLAMA 3.2Judge Model=LL-3.22025.12 | 0.2 | 0.05 | |
| Gemma 3Judge Model=Gemma 32025.12 | 0.17 | 0.04 | |
| Phi 4Judge Model=Phi 42025.12 | 0.14 | 0.05 |