Hallucination Detection on FELM worldknowledge (test)
88.3Nonfact AccuracyDoc
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DocBackbone LLM=GPT-42024.02 | 88.3 | 40.8 | 64.6 | |
| DocBackbone LLM=Vicuna-33B2024.02 | 81.6 | 17.9 | 49.8 | |
| VanillaBackbone LLM=Vicuna-33B2024.02 | 72.8 | 34 | 53.4 | |
| LinkBackbone LLM=Vicuna-33B2024.02 | 70.7 | 29.9 | 50.3 | |
| CEGBackbone LLM=GPT-42024.02 | 54.4 | 85.5 | 69.9 | |
| CoTBackbone LLM=GPT-42024.02 | 42.9 | 94 | 68.4 | |
| CoTBackbone LLM=Vicuna-33B2024.02 | 40.8 | 62.3 | 51.6 | |
| CEGBackbone LLM=ChatGPT2024.02 | 40.1 | 79.2 | 59.7 | |
| LinkBackbone LLM=GPT-42024.02 | 35.4 | 93.2 | 64.3 | |
| DocBackbone LLM=ChatGPT2024.02 | 34.7 | 73.2 | 54 | |
| VanillaBackbone LLM=GPT-42024.02 | 21.8 | 95.3 | 58.5 | |
| LinkBackbone LLM=ChatGPT2024.02 | 11.6 | 94.3 | 52.9 | |
| CEGBackbone LLM=Vicuna-33B2024.02 | 8.8 | 95.1 | 52 | |
| VanillaBackbone LLM=ChatGPT2024.02 | 3.4 | 96.1 | 49.8 | |
| CoTBackbone LLM=ChatGPT2024.02 | 2.7 | 96.9 | 49.8 |