Hallucination Detection on TriviaQA Llama outputs (test)
0.844AUROCGPT-4o judge
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o judgeScorer Category=Judge2026.06 | 0.844 | |
| Sonnet judgeScorer Category=Judge2026.06 | 0.844 | |
| Gemini judgeScorer Category=Judge2026.06 | 0.83 | |
| Non-Cont.Scorer Category=BB2026.06 | 0.81 | |
| Semantic Neg.Scorer Category=BB2026.06 | 0.792 | |
| EntailmentScorer Category=BB2026.06 | 0.791 | |
| Sem. Sets Conf.Scorer Category=BB2026.06 | 0.791 | |
| P(True)Scorer Category=WB2026.06 | 0.791 | |
| Cosine Sim.Scorer Category=BB2026.06 | 0.749 | |
| Mean Token Neg.Scorer Category=WB2026.06 | 0.7 | |
| Exact MatchScorer Category=BB2026.06 | 0.677 | |
| Sequence Prob.Scorer Category=WB2026.06 | 0.676 | |
| Prob. MarginScorer Category=WB2026.06 | 0.674 | |
| Llama judgeScorer Category=Judge2026.06 | 0.667 | |
| Min Token Prob.Scorer Category=WB2026.06 | 0.661 |