Hallucination Detection on TruthfulQA (80% test)
0.6887AUROC (T=0)PRISM-SAPLMA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PRISM-SAPLMABackbone=LLaMA2-7B-Chat, Framework=PRISM, Prompt Template=Prompt 3, Training Epochs=10, Training Split=20%2024.11 | 0.6887 | 0.6939 | 0.7248 | |
| PRISM-MMBackbone=LLaMA2-7B-Chat, Framework=PRISM, Prompt Template=Prompt 3, Training Epochs=10, Training Split=20%2024.11 | 0.6808 | 0.7082 | 0.7114 | |
| SAPLMABackbone=LLaMA2-7B-Chat, Training Epochs=10, Training Split=20%, Feature Source=middle layer internal states2024.11 | 0.6389 | 0.6603 | 0.6654 | |
| SelfcheckGPTBackbone=LLaMA2-7B-Chat, Sampling strategy=greedy, Unsupervised=true, Consistency samples=20, Consistency LLM=GPT-42024.11 | 0.5937 | 0.6168 | 0.6357 | |
| MMBackbone=LLaMA2-7B-Chat, Training Epochs=10, Training Split=20%, Feature Source=middle layer internal states2024.11 | 0.5654 | 0.5559 | 0.5279 |