Knowledge Graph Question Answering on CWQ (test)
88.95Hits@1OPI-BR
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| OPI-BRSetting=Retrieval-only2026.06 | 88.95 | 29.78 | — | — | — | — | |
| TRACEType=LLMs with KGs2026.04 | 76.9 | 72.9 | — | — | — | — | |
| OPIType=KGs+LLMs, Backbone=Llama-2-7B + DeepSeek-v32026.06 | 76.5 | 59.6 | — | — | — | — | |
| DPType=LLMs with KGs2026.04 | 75.8 | 69.4 | — | — | — | — | |
| PoGMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-42024.10 | 75 | — | — | — | — | — | |
| STEMEvaluation Protocol=Our Proposed Method, Backbone LLM=GPT-4o2026.04 | 74.09 | 65.33 | — | — | — | — | |
| ProgRAGEvaluation Protocol=Prompting, Backbone LLM=gpt-4o-mini2026.04 | 73.3 | — | — | — | — | — | |
| SCPRM-MCTSbase LLM=Llama3.1-8B2026.05 | 73.29 | — | — | — | — | — | |
| ReKG-MCTSbase LLM=GPT-4o-mini2026.05 | 72.78 | — | — | — | — | — | |
| STEMEvaluation Protocol=Our Proposed Method, Backbone LLM=Llama-3.1-70B2026.04 | 72.53 | 62.09 | — | — | — | — | |
| ToGBase Model=GPT-42026.06 | 72.5 | — | — | — | — | — | |
| RwTType=LLMs with KGs2026.04 | 72.4 | 66.7 | — | — | — | — | |
| OPIType=KGs+LLMs, Backbone=Llama-2-7B + GPT-4o2026.06 | 72.3 | 62.7 | — | — | — | — | |
| FiDeLisType=LLMs with KGs2026.04 | 71.5 | 64.3 | — | — | — | — | |
| FiDeLiSEvaluation Protocol=Prompting, Backbone LLM=gpt-4-turbo2026.04 | 71.47 | 64.32 | — | — | — | — | |
| RL-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=CoT2026.01 | 71.3 | 49.8 | 67.5 | 17.6 | — | — | |
| ToGbase LLM=GPT-4o-mini2026.05 | 70.87 | — | — | — | — | — | |
| FRAG-FBackbone=Llama-3-70B-Instruct, Type=Modular KG-RAG2025.01 | 70.8 | — | — | — | — | — | |
| RL-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=Vanilla2026.01 | 70.5 | 50.1 | 66.6 | 17.9 | — | — | |
| DeCAFFEvaluation Protocol=Finetuning, Backbone LLM=FiD-3B2026.04 | 70.42 | — | — | — | — | — | |
| DeCAFMethod Category=Fine-Tuned KG-Augmented LLM2024.10 | 70.4 | — | — | — | — | — | |
| DECAFType=Semantic Parsing2026.04 | 70.4 | — | — | — | — | — | |
| Prior FT SOTANote=Fine-tuned2026.06 | 70.4 | — | — | — | — | — | |
| RoGEvaluation Protocol=Finetuning, Backbone LLM=GPT-4o2026.04 | 69.61 | 61.97 | — | — | — | — | |
| FRAGBackbone=Llama-3-70B-Instruct, Type=Modular KG-RAG2025.01 | 69.4 | — | — | — | — | — | |
| GCR-BRSetting=Retrieval-only2026.06 | 69.12 | 39.44 | — | — | — | — | |
| SFT-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=CoT2026.01 | 69 | 47.7 | 64.7 | 17.8 | — | — | |
| ReasoningLMType=LLMs with KGs2026.04 | 69 | 64 | — | — | — | — | |
| SFT-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=Vanilla2026.01 | 68.8 | 48.1 | 64.3 | 17.9 | — | — | |
| STEMEvaluation Protocol=Our Proposed Method, Backbone LLM=Llama-3.1-8B2026.04 | 68.76 | 60.81 | — | — | — | — | |
| ToGType=LLMs with KGs2026.04 | 68.5 | 60.2 | — | — | — | — | |
| FRAG-FBackbone=GPT-4o-mini, Type=Modular KG-RAG2025.01 | 68 | — | — | — | — | — | |
| ToGMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-42024.10 | 67.6 | — | — | — | — | — | |
| ToGType=KGs+LLMs, Backbone=GPT-42026.06 | 67.6 | — | — | — | — | — | |
| RoGEvaluation Protocol=Finetuning, Backbone LLM=Llama-3.1-70B2026.04 | 67.43 | 60.3 | — | — | — | — | |
| GNN-RAGEvaluation Protocol=Finetuning, Backbone LLM=Llama2-7B2026.04 | 67.3 | 59.1 | — | — | — | — | |
| FRAGBackbone=GPT-4o-mini, Type=Modular KG-RAG2025.01 | 66.9 | — | — | — | — | — | |
| GNN-RAGType=KGs+LLMs, Backbone=Llama-2-7B2026.06 | 66.8 | 59.4 | — | — | — | — | |
| FRAG-FBackbone=Llama-3-8B-Instruct, Type=Modular KG-RAG2025.01 | 66.1 | — | — | — | — | — | |
| GCRType=KGs+LLMs, Backbone=Llama-2-7B + GPT-4o2026.06 | 66 | 58.5 | — | — | — | — | |
| ORTType=KGs+LLMs, Backbone=GPT-4o2026.06 | 65.4 | 58.7 | — | — | — | — | |
| HGNetType=Traditional KGQA2025.01 | 65.3 | — | — | — | — | — | |
| RoGKG Evidence=Relational Path, UQ Method=Vanilla2026.01 | 65.3 | 43 | 60.5 | 27.4 | — | — | |
| RoGKG Evidence=Relational Path, UQ Method=CoT2026.01 | 65.3 | 43.7 | 60.4 | 27.6 | — | — | |
| DualRType=LLMs with KGs2026.04 | 65.3 | 62.1 | — | — | — | — | |
| FRAGBackbone=Llama-3-8B-Instruct, Type=Modular KG-RAG2025.01 | 64.9 | — | — | — | — | — | |
| RL-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=Self-Probing2026.01 | 64.6 | 53 | 60.8 | 23.5 | — | — | |
| R^2Type=KGs+LLMs, Backbone=Llama-2-7B2026.06 | 64 | 58 | — | — | — | — | |
| PoGMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-3.5 or others2024.10 | 63.2 | — | — | — | — | — | |
| SFT-DoublyCalKG Evidence=Constrained Relational Path, UQ Method=Self-Probing2026.01 | 63.2 | 50.9 | 58.5 | 22.5 | — | — | |
| PoGEvaluation Protocol=Prompting, Backbone LLM=gpt-3.52026.04 | 63.2 | — | — | — | — | — | |
| SGRBase Model=GPT-42026.06 | 63.2 | — | — | — | — | 59 | |
| GNN-RAGType=LLMs with KGs2026.04 | 62.8 | 60.4 | — | — | — | — | |
| MFCEvaluation Protocol=Prompting, Backbone LLM=gpt-4o-mini2026.04 | 62.8 | — | — | — | — | — | |
| RoGMethod Category=Fine-Tuned KG-Augmented LLM2024.10 | 62.6 | — | — | — | — | — | |
| RoGType=Coupled KG-RAG2025.01 | 62.6 | — | — | — | — | — | |
| RoGType=KGs+LLMs, Backbone=Llama-2-7B2026.06 | 62.6 | 56.2 | — | — | — | — | |
| FRAG-FBackbone=Llama-2-70b-chat-hf, Type=Modular KG-RAG2025.01 | 62.2 | — | — | — | — | — | |
| RoGKG Evidence=Relational Path, UQ Method=Self-Probing2026.01 | 61.9 | 48.7 | 56.9 | 38 | — | — | |
| GNN-RAGType=Coupled KG-RAG2025.01 | 61.7 | — | — | — | — | — | |
| FRAG-FBackbone=ChatGPT, Type=Modular KG-RAG2025.01 | 61.5 | — | — | — | — | — | |
| SubgraphRAGKG Evidence=Subgraph, UQ Method=Vanilla2026.01 | 61.5 | 52.2 | 57.4 | 39.9 | — | — | |
| RoGEvaluation Protocol=Finetuning, Backbone LLM=Llama2-Chat-7B2026.04 | 61.39 | 56.17 | — | — | — | — | |
| FRAGBackbone=ChatGPT, Type=Modular KG-RAG2025.01 | 61 | — | — | — | — | — | |
| FiDeLiSBackend Model=Mistral-7B, temperature=0.3, top_p=1.02024.05 | 60.71 | 56.87 | — | — | — | — | |
| FRAGBackbone=Llama-2-70b-chat-hf, Type=Modular KG-RAG2025.01 | 60.1 | — | — | — | — | — | |
| SubgraphRAGKG Evidence=Subgraph, UQ Method=Self-Probing2026.01 | 59.9 | 50.2 | 56 | 39.1 | — | — | |
| SubgraphRAGKG Evidence=Subgraph, UQ Method=CoT2026.01 | 59.4 | 51.4 | 55.7 | 38.9 | — | — | |
| GPT-4o+CoTEvaluation Protocol=CoT, Backbone LLM=GPT-4o2026.04 | 59.36 | 48.24 | — | — | — | — | |
| LightProfEvaluation Protocol=Finetuning, Backbone LLM=Llama3-8B2026.04 | 59.3 | — | — | — | — | — | |
| InteractiveKBQAMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-42024.10 | 59.2 | — | — | — | — | — | |
| ReKnoSEvaluation Protocol=Prompting, Backbone LLM=gpt-3.52026.04 | 58.5 | — | — | — | — | — | |
| FiDeLiSBackend Model=Llama-2-13B, temperature=0.3, top_p=1.02024.05 | 58.41 | 54.78 | — | — | — | — | |
| Program TransferType=Traditional KGQA2025.01 | 58.1 | — | — | — | — | — | |
| RoGType=LLMs with KGs2026.04 | 57.8 | 56.2 | — | — | — | — | |
| SGRBase Model=ChatGPT2026.06 | 57.8 | — | — | — | — | 52.6 | |
| ToGBackbone=Llama-2-70b-chat-hf, Type=Modular KG-RAG2025.01 | 57.6 | — | — | — | — | — | |
| GPT-4o+FewshotEvaluation Protocol=Fewshot, Backbone LLM=GPT-4o2026.04 | 57.59 | 44.72 | — | — | — | — | |
| ToGEvaluation Protocol=Prompting, Backbone LLM=gpt-3.5-turbo2026.04 | 57.59 | 56.64 | — | — | — | — | |
| ToGMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-3.5 or others2024.10 | 57.1 | — | — | — | — | — | |
| ToGBackbone=ChatGPT, Type=Modular KG-RAG2025.01 | 57.1 | — | — | — | — | — | |
| ToGBase Model=ChatGPT2026.06 | 57.1 | — | — | — | — | — | |
| SubgraphRAGEvaluation Protocol=Prompting, Backbone LLM=gpt-4o2026.04 | 56.3 | — | — | — | — | — | |
| KD-CoTType=LLMs with KGs2026.04 | 55.7 | — | — | — | — | — | |
| StructGPTMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-3.5 or others2024.10 | 54.3 | — | — | — | — | — | |
| NSMEvaluation Protocol=Finetuning2026.04 | 53.92 | — | — | — | — | — | |
| NutreaType=LLMs with KGs2026.04 | 53.6 | 49.5 | — | — | — | — | |
| KapingEvaluation Protocol=Prompting, Backbone LLM=gpt-3.5-turbo2026.04 | 53.42 | 50.32 | — | — | — | — | |
| KAPINGType=LLMs with KGs2026.04 | 53.4 | 50.3 | — | — | — | — | |
| RoG-BRSetting=Retrieval-only2026.06 | 52.56 | 21.5 | — | — | — | — | |
| SGRBase Model=Cypher LLM2026.06 | 52.3 | — | — | — | — | 44.5 | |
| UniKGQAMethod Category=Fine-Tuned KG-Augmented LLM2024.10 | 51.2 | — | — | — | — | — | |
| UniKGQAType=Traditional KGQA2025.01 | 51.2 | — | — | — | — | — | |
| UniKGQAType=LLMs with KGs2026.04 | 51.2 | 49 | — | — | — | — | |
| UniKGQAType=Retrieval-based2026.06 | 51.2 | 49.1 | — | — | — | — | |
| KD-CoTMethod Category=Prompting KG-Augmented LLM, Base LLM=GPT-3.5 or others2024.10 | 50.5 | — | — | — | — | — | |
| KD-CoTBackbone=ChatGPT, Type=Modular KG-RAG2025.01 | 50.5 | — | — | — | — | — | |
| KD-CoTEvaluation Protocol=Finetuning, Backbone LLM=T5-large2026.04 | 50.5 | — | — | — | — | — | |
| RE-KBQAMethod Category=Fine-Tuned KG-Augmented LLM2024.10 | 50.3 | — | — | — | — | — | |
| SR+NSMType=Traditional KGQA2025.01 | 50.2 | — | — | — | — | — |