Question Answering on ConflictQA-TripleConf non-complementary
90.42F1 (Positional)Deepseek-V3.2
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Deepseek-V3.2Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.42 | 43.6 | 46.82 | 86.41 | 30.3 | 56.11 | |
| GPT-5.1Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.17 | 46.74 | 43.43 | 87.28 | 32.05 | 55.23 | |
| o3-miniModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.06 | 51 | 39.06 | 86.91 | 38.03 | 48.88 | |
| GPT-4oModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 88.44 | 54.39 | 34.05 | 85.41 | 32.67 | 52.74 | |
| GPT-3.5-Turbo-0125Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 88.2 | 53.93 | 34.27 | 83.17 | 36.41 | 46.76 | |
| Qwen3-8BModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 86.01 | 21.85 | 64.16 | 76.28 | 7.61 | 68.67 | |
| Mistral-Large-2512Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.91 | 53.65 | 31.26 | 78.18 | 29.3 | 48.88 | |
| Llama-3.1-70B-InstructModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.72 | 46.83 | 37.89 | 79.8 | 32.67 | 47.13 | |
| Qwen3-30B-A3B-ThinkingModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.43 | 44.44 | 39.99 | 79.18 | 32.61 | 46.57 | |
| Deepseek-V3.2-ThinkingModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.18 | 54.63 | 29.55 | 79.3 | 33.23 | 46.07 | |
| Open-Mistral-7BModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 81.45 | 29.7 | 51.75 | 65.59 | 13.47 | 52.12 | |
| Llama-3.1-8B-InstructModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 67.3 | 36.82 | 30.48 | 50.75 | 19.2 | 31.55 |