Hallucination Detection on PopQA Llama outputs (test)
0.77AUROCGPT-4o judge
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o judgeScorer Category=Judge2026.06 | 0.77 | |
| P(True)Scorer Category=WB2026.06 | 0.695 | |
| Gemini judgeScorer Category=Judge2026.06 | 0.683 | |
| Non-Cont.Scorer Category=BB2026.06 | 0.666 | |
| Cosine Sim.Scorer Category=BB2026.06 | 0.666 | |
| EntailmentScorer Category=BB2026.06 | 0.629 | |
| Sonnet judgeScorer Category=Judge2026.06 | 0.627 | |
| Llama judgeScorer Category=Judge2026.06 | 0.624 | |
| Sequence Prob.Scorer Category=WB2026.06 | 0.623 | |
| Semantic Neg.Scorer Category=BB2026.06 | 0.606 | |
| Sem. Sets Conf.Scorer Category=BB2026.06 | 0.606 | |
| Mean Token Neg.Scorer Category=WB2026.06 | 0.606 | |
| Prob. MarginScorer Category=WB2026.06 | 0.605 | |
| Min Token Prob.Scorer Category=WB2026.06 | 0.543 | |
| Exact MatchScorer Category=BB2026.06 | 0.501 |