Question Answering on QALD en (WikiData) v10 (test)
83.73Hits@1KG-Reasoner with Qwen-2.5-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| KG-Reasoner with Qwen-2.5-7BSize=7B, KG Integration=WikiData, Fine-tuning Protocol=KG-Reasoner Fine-Tuning2026.04 | 83.73 | |
| GPT-4o-mini + KGSize=–, KG Integration=WikiData, Fine-tuning Protocol=None2026.04 | 72.86 | |
| LLaMA-3.3-70B + KGSize=70B, KG Integration=WikiData, Fine-tuning Protocol=None2026.04 | 71.78 | |
| DeepSeek-R1-Distill-Llama-70B + KGSize=70B, KG Integration=WikiData, Fine-tuning Protocol=None2026.04 | 66.1 | |
| Qwen-2.5-7B (SFT) + KGSize=7B, KG Integration=WikiData, Fine-tuning Protocol=SFT2026.04 | 65.18 | |
| LLaMA-3.1-8B (SFT) + KGSize=8B, KG Integration=WikiData, Fine-tuning Protocol=SFT2026.04 | 59.63 | |
| Qwen-2.5-7B + KGSize=7B, KG Integration=WikiData, Fine-tuning Protocol=None2026.04 | 56.54 | |
| GPT-4oSize=–, KG Integration=None, Fine-tuning Protocol=None2026.04 | 56.2 | |
| LLaMA-3.3-70BSize=70B, KG Integration=None, Fine-tuning Protocol=None2026.04 | 56 | |
| LLaMA-3.1-8B + KGSize=8B, KG Integration=WikiData, Fine-tuning Protocol=None2026.04 | 55.73 | |
| ToG-2.0 (ICL)(GPT-3.5-turbo)Size=-, KG Integration=WikiData, Fine-tuning Protocol=ICL2026.04 | 54.1 | |
| ToG with GPT 4Size=–, KG Integration=WikiData, Fine-tuning Protocol=Search-based2026.04 | 53.8 | |
| GPT-4o-miniSize=–, KG Integration=None, Fine-tuning Protocol=None2026.04 | 51.98 | |
| ToG with GPT 3.5-TurboSize=–, KG Integration=WikiData, Fine-tuning Protocol=Search-based2026.04 | 50.2 | |
| DeepSeek-R1-Distill-Llama-70BSize=70B, KG Integration=None, Fine-tuning Protocol=None2026.04 | 43.1 | |
| Qwen-2.5-7BSize=7B, KG Integration=None, Fine-tuning Protocol=None2026.04 | 41.88 | |
| LLaMA-3.1-8BSize=8B, KG Integration=None, Fine-tuning Protocol=None2026.04 | 40.25 |