Knowledge Base Question Answering on GrailQA
89.3Hits@1LMP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LMP2026.04 | 89.3 | — | |
| KG-AgentMethodology=KG + LLM with Fine-Tuning (LLM Backbone Fine-Tuning)2026.04 | 86.1 | — | |
| KG-Agent2026.04 | 86.1 | — | |
| GraSP2026.04 | 84 | — | |
| ToGBackbone=GPT-4, Reasoning Strategy=ToG2025.12 | 81.4 | — | |
| ToG with GPT 4Methodology=KG + LLMs w/o Fine-Tuning2026.04 | 81.4 | — | |
| ToGBackbone Model=GPT-42026.05 | 81.4 | — | |
| KG-ReasonerSize=30B, Methodology=KG + LLM with Fine-Tuning (LLM Backbone Fine-Tuning)2026.04 | 76.86 | — | |
| SGRBackbone=GPT-4, Reasoning Strategy=SGR2025.12 | 75.6 | 70.3 | |
| SGRBackbone Model=GPT-42026.05 | 75.6 | 70.3 | |
| Prior FT SOTAEvaluation Protocol=Fine-tuned2025.12 | 75.4 | — | |
| Prior FT SOTA2026.05 | 75.4 | — | |
| iQUEST2026.04 | 73.5 | — | |
| KBQA-o12026.04 | 72.9 | — | |
| SGRBackbone=ChatGPT, Reasoning Strategy=SGR2025.12 | 71.3 | 63.3 | |
| SGRBackbone Model=ChatGPT2026.05 | 71.3 | 63.3 | |
| ToG2026.04 | 69.4 | — | |
| ToGBackbone=ChatGPT, Reasoning Strategy=ToG2025.12 | 68.7 | — | |
| ToGBackbone Model=ChatGPT2026.05 | 68.7 | — | |
| SGRBackbone=Cypher LLM, Reasoning Strategy=SGR2025.12 | 62.4 | 59.3 | |
| SGRBackbone Model=Cypher LLM2026.05 | 62.4 | 59.3 | |
| GPT-4o-mini + KGMethodology=KG + LLMs w/o Fine-Tuning2026.04 | 60 | — | |
| DeepSeek-R1-Distill-Llama-70B + KGSize=70B, Methodology=KG + LLMs w/o Fine-Tuning2026.04 | 59.02 | — | |
| LLaMA-3.3-70B + KGSize=70B, Methodology=KG + LLMs w/o Fine-Tuning2026.04 | 57.7 | — | |
| Prior Prompting SOTAEvaluation Protocol=Prompting2025.12 | 53.2 | — | |
| Prior Prompting SOTA2026.05 | 53.2 | — | |
| LLaMA-3.1-8B (SFT) + KGSize=8B, Methodology=KG + LLM with Fine-Tuning (LLM Backbone Fine-Tuning)2026.04 | 47.7 | — | |
| Qwen-2.5-7B (SFT) + KGSize=7B, Methodology=KG + LLM with Fine-Tuning (LLM Backbone Fine-Tuning)2026.04 | 46.18 | — | |
| Qwen-2.5-7B + KGSize=7B, Methodology=KG + LLMs w/o Fine-Tuning2026.04 | 41.1 | — | |
| LLaMA-3.1-8B + KGSize=8B, Methodology=KG + LLMs w/o Fine-Tuning2026.04 | 40.4 | — | |
| GPT-4o-miniMethodology=LLM w/o KG2026.04 | 36.22 | — | |
| GPT-4oMethodology=LLM w/o KG2026.04 | 35.01 | — | |
| LLaMA-3.3-70BSize=70B, Methodology=LLM w/o KG2026.04 | 33.79 | — | |
| DeepSeek-R1-Distill-Llama-70BSize=70B, Methodology=LLM w/o KG2026.04 | 31.7 | — | |
| Qwen-2.5-7BSize=7B, Methodology=LLM w/o KG2026.04 | 29.53 | — | |
| IO PromptBackbone=ChatGPT, Reasoning Strategy=IO Prompt2025.12 | 29.4 | 22.3 | |
| IO PromptBackbone Model=ChatGPT2026.05 | 29.4 | 22.3 | |
| LLaMA-3.1-8BSize=8B, Methodology=LLM w/o KG2026.04 | 28.35 | — | |
| CoTBackbone=ChatGPT, Reasoning Strategy=CoT2025.12 | 28.1 | 20.1 | |
| CoTBackbone Model=ChatGPT2026.05 | 28.1 | 20.1 | |
| CoT2026.01 | — | 28.1 | |
| DeSQBackbone=Phi-42026.05 | — | 66 | |
| DoG2026.01 | — | 80 | |
| FLAREFramework=ToG2026.01 | — | 86.7 | |
| FLAREFramework=PoG2026.01 | — | 92 | |
| Gao et al., 20252026.05 | — | 79 | |
| IO Prompt2026.01 | — | 29.4 | |
| KB-BINDER2026.01 | — | 58.5 | |
| LATS2026.01 | — | 58.1 | |
| PoG2026.01 | — | 84.7 | |
| RAP2026.01 | — | 49.7 | |
| SC2026.01 | — | 29.6 | |
| T5-3BBackbone=T5-3B2022.01 | — | 70.11 | |
| T5-baseBackbone=T5-base2022.01 | — | 62.39 | |
| T5-largeBackbone=T5-large2022.01 | — | 67.3 | |
| ToG2026.01 | — | 81.4 | |
| ToT2026.01 | — | 44.2 | |
| Ye et al. (2021b)Extra Pre-training=false2022.01 | — | 83.8 |