Hallucination Detection on PopQA GPT outputs (test)
0.802AUROCMean Token Neg.
Evaluation Results
| Method | Links | |
|---|---|---|
| Mean Token Neg.Scorer Category=WB2026.06 | 0.802 | |
| P(True)Scorer Category=WB2026.06 | 0.795 | |
| Prob. MarginScorer Category=WB2026.06 | 0.784 | |
| Cosine Sim.Scorer Category=BB2026.06 | 0.774 | |
| Sequence Prob.Scorer Category=WB2026.06 | 0.754 | |
| Llama judgeScorer Category=Judge2026.06 | 0.744 | |
| Sonnet judgeScorer Category=Judge2026.06 | 0.714 | |
| Non-Cont.Scorer Category=BB2026.06 | 0.684 | |
| Min Token Prob.Scorer Category=WB2026.06 | 0.679 | |
| GPT-4o judgeScorer Category=Judge2026.06 | 0.643 | |
| EntailmentScorer Category=BB2026.06 | 0.607 | |
| Sem. Sets Conf.Scorer Category=BB2026.06 | 0.602 | |
| Semantic Neg.Scorer Category=BB2026.06 | 0.589 | |
| Exact MatchScorer Category=BB2026.06 | 0.575 | |
| Gemini judgeScorer Category=Judge2026.06 | 0.571 |