Question Answering on ConflictQA-TextConf non-complementary
90.42F1 (Pos)Deepseek-V3.2
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Deepseek-V3.2Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.42 | 66.64 | 23.78 | 86.41 | 53.43 | 32.98 | |
| GPT-5.1Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.17 | 68.45 | 21.72 | 87.28 | 51.88 | 35.4 | |
| o3-miniModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 90.06 | 66.66 | 23.4 | 86.91 | 52.56 | 34.35 | |
| GPT-4oModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 88.44 | 70.43 | 18.01 | 85.41 | 46.57 | 38.84 | |
| GPT-3.5-Turbo-0125Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 88.2 | 62.65 | 25.55 | 83.17 | 43.77 | 39.4 | |
| Qwen3-8BModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 86.01 | 76.24 | 9.77 | 76.28 | 52.44 | 23.84 | |
| Mistral-Large-2512Model Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.91 | 61.5 | 23.41 | 78.18 | 32.17 | 46.01 | |
| Llama-3.1-70B-InstructModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.72 | 63.1 | 21.62 | 79.8 | 48.96 | 30.84 | |
| Qwen3-30B-A3B-ThinkingModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.43 | 60.91 | 23.52 | 79.18 | 48.69 | 30.49 | |
| Deepseek-V3.2-ThinkingModel Type=Reasoning LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 84.18 | 62.73 | 21.45 | 79.3 | 40.15 | 39.15 | |
| Open-Mistral-7BModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 81.45 | 67.1 | 14.35 | 65.59 | 47.07 | 18.52 | |
| Llama-3.1-8B-InstructModel Type=General LLM, Zero-shot=true, Conflict-aware QA prompt=true2026.04 | 67.3 | 63.39 | 3.91 | 50.75 | 41.15 | 9.6 |