Hallucination Detection on SciQ (AUROC)
64.8AUROCEigenWD M1
Evaluation Results
| Method | Links | |
|---|---|---|
| EigenWD M1Target Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 64.8 | |
| ERTarget Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 63.98 | |
| DSETarget Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 59.78 | |
| LNETarget Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 59.16 | |
| ESTarget Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 57.84 | |
| LSTarget Model=DeepSeek-Chat, Teacher Model=Llama-2-7B, Detection Setting=Black-box case study2026.03 | 49.21 | |
| HCPDSource Model=Qwen-3-8b, Target Model=LLaMA-2-13b2026.06 | 0.9663 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-13b2026.06 | 0.9548 | |
| HCPDModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.9263 | |
| HCPDSource Model=Qwen-3-8b, Target Model=Qwen-3-8b2026.06 | 0.9263 | |
| HCPDSource Model=Qwen-3-8b, Target Model=Qwen-2.5-7b2026.06 | 0.9257 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-7b2026.06 | 0.9247 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=Qwen-3-8b2026.06 | 0.9189 | |
| HCPDSource Model=Qwen-3-8b, Target Model=LLaMA-2-7b2026.06 | 0.9051 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-7b2026.06 | 0.8992 | |
| SAPLMAModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.8663 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=Qwen-3-8b2026.06 | 0.8663 | |
| HCPDModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.8604 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.8604 | |
| SAPLMAModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.8563 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.8563 | |
| HCPDSource Model=Qwen-3-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.8539 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.8521 | |
| HCPDSource Model=Qwen-3-8b, Target Model=Qwen-2.5-14b2026.06 | 0.8421 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=LLaMA-2-7b2026.06 | 0.8411 | |
| TSVModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.8001 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.8001 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=LLaMA-2-13b2026.06 | 0.7988 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-7b2026.06 | 0.7977 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=Qwen-3-8b2026.06 | 0.7905 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-13b2026.06 | 0.7895 | |
| TSVModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.7877 | |
| TSVSource Model=Qwen-3-8b, Target Model=Qwen-3-8b2026.06 | 0.7877 | |
| HCPDSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-14b2026.06 | 0.782 | |
| Semantic EntropyModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.7781 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=Qwen-2.5-7b2026.06 | 0.7708 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-7b2026.06 | 0.7564 | |
| HaloScopeModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.7498 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=Qwen-3-8b2026.06 | 0.7498 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-7b2026.06 | 0.7465 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-13b2026.06 | 0.7096 | |
| Semantic EntropyModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.7084 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=Qwen-3-8b2026.06 | 0.7046 | |
| HaloScopeModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.6904 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.6904 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-7b2026.06 | 0.6877 | |
| SAPLMASource Model=Qwen-3-8b, Target Model=Qwen-2.5-14b2026.06 | 0.6839 | |
| Lexical SimilarityModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.6709 | |
| SelfCKGPTModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.6678 | |
| TADModel=Llama-3.1-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.6675 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-7b2026.06 | 0.6615 | |
| PerplexityModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.6612 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=Qwen-2.5-7b2026.06 | 0.6518 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-7b2026.06 | 0.6456 | |
| TSVSource Model=Qwen-3-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.6367 | |
| SAPLMASource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-14b2026.06 | 0.6316 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=Qwen-3-8b2026.06 | 0.6287 | |
| LN-EntropyModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.6269 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=LLaMA-2-13b2026.06 | 0.6186 | |
| HaloScopeSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-14b2026.06 | 0.6165 | |
| LN-EntropyModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.6122 | |
| TSVSource Model=Qwen-3-8b, Target Model=Qwen-2.5-7b2026.06 | 0.6067 | |
| SelfCKGPTModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.5968 | |
| PerplexityModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.5927 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=Qwen-2.5-14b2026.06 | 0.5916 | |
| TSVSource Model=Qwen-3-8b, Target Model=Qwen-2.5-14b2026.06 | 0.5906 | |
| CCSModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.5885 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=LLaMA-2-7b2026.06 | 0.5831 | |
| CCSModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.5796 | |
| TSVSource Model=Qwen-3-8b, Target Model=LLaMA-2-7b2026.06 | 0.5788 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=LLaMA-2-13b2026.06 | 0.5742 | |
| TSVSource Model=Qwen-3-8b, Target Model=LLaMA-2-13b2026.06 | 0.5689 | |
| TSVSource Model=LLaMA-3.1-8b, Target Model=Qwen-2.5-14b2026.06 | 0.561 | |
| TADModel=Qwen-3-8b, Supervision=Trained on fully labeled datasets2026.06 | 0.5598 | |
| Self-evaluationModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.5412 | |
| Lexical SimilarityModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.5361 | |
| HaloScopeSource Model=Qwen-3-8b, Target Model=LLaMA-3.1-8b2026.06 | 0.536 | |
| EigenScoreModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.5285 | |
| EigenScoreModel=Llama-3.1-8b, Supervision=Zero-source2026.06 | 0.5152 | |
| Self-evaluationModel=Qwen-3-8b, Supervision=Zero-source2026.06 | 0.5136 |