Hallucination Mitigation on Factual Grounding and Causal Reasoning Evaluation Set
4.25ACCIP
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| CIPModel Variant=Gemini-1.5-Flash, Prompting Strategy=Causal Prompting2025.12 | 4.25 | 0.52 | 0.21 | 0.23 | — | 2.33 | 0.37 | |
| CIPModel Variant=Gemini-2.0-Flash, Prompting Strategy=Causal Prompting2025.12 | 4.02 | 0.5 | 0.25 | 0.28 | — | 2.54 | 0.38 | |
| CIPModel Variant=GPT-4o, Prompting Strategy=Causal Prompting2025.12 | 2.96 | 0.4 | 0.48 | 0.42 | — | 2.61 | 0.35 | |
| CIPModel Variant=Llama-3.1-70B, Prompting Strategy=Causal Prompting2025.12 | 2.1 | 0.38 | 0.35 | 0.33 | — | 1.3 | 0.26 | |
| Direct PromptingModel Variant=Gemini-1.5-Flash, Prompting Strategy=Direct Prompting2025.12 | 1.92 | 0.15 | — | — | — | — | — | |
| CIPModel Variant=Qwen-32B-Preview, Prompting Strategy=Causal Prompting2025.12 | 1.5 | 0.32 | 0.23 | 0.22 | — | 1.15 | 0.24 | |
| Direct PromptingModel Variant=Gemini-2.0-Flash, Prompting Strategy=Direct Prompting2025.12 | 1.48 | 0.12 | — | — | — | — | — | |
| CIPModel Variant=Qwen-2.5-7B-Instruct, Prompting Strategy=Causal Prompting2025.12 | 1.16 | 0.3 | 0.16 | 0.17 | 0.001 | 0.69 | 0.2 | |
| CIPModel Variant=Llama-3.1-8B, Prompting Strategy=Causal Prompting2025.12 | 0.8 | 0.25 | 0.18 | 0.16 | 0.002 | 0.6 | 0.18 | |
| Direct PromptingModel Variant=Llama-3.1-70B, Prompting Strategy=Direct Prompting2025.12 | 0.8 | 0.12 | — | — | — | — | — | |
| Direct PromptingModel Variant=Qwen-2.5-7B-Instruct, Prompting Strategy=Direct Prompting2025.12 | 0.47 | 0.1 | — | — | — | — | — | |
| Direct PromptingModel Variant=GPT-4o, Prompting Strategy=Direct Prompting2025.12 | 0.35 | 0.05 | — | — | — | — | — | |
| Direct PromptingModel Variant=Qwen-32B-Preview, Prompting Strategy=Direct Prompting2025.12 | 0.35 | 0.08 | — | — | — | — | — | |
| Direct PromptingModel Variant=Llama-3.1-8B, Prompting Strategy=Direct Prompting2025.12 | 0.2 | 0.07 | — | — | — | — | — |