Table Question Answering on WikiTQ (test)
84.3AccuracyCommented Reasoning Framework + Answer Selector with Table-R1
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Commented Reasoning Framework + Answer Selector with Table-R1Code Base Model=Qwen2.5-Coder-7B-Instruct, Answer Selector Model=Qwen3-4B-Instruct-2507, Integrated Model=Table-R12026.01 | 84.3 | — | — | — | |
| Table-R1Base Model=Llama-3.1-8B-Instruct2026.01 | 81.7 | — | — | — | |
| TableMasterBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 78.13 | — | — | — | |
| TableMind++Model Category=Tuning-based, Pass@1=true2026.03 | 78.07 | — | — | — | |
| TableMasterBackbone=Llama-3.170B, Evaluation Protocol=Single inference run2025.01 | 77.95 | — | — | — | |
| GPT-5Model Category=Proprietary, Pass@1=true2026.03 | 77.42 | — | — | — | |
| TableMindModel Category=Tuning-based, Pass@1=true2026.03 | 76.82 | — | — | — | |
| TabLaPBase Model=GPT-3.5-Turbo2026.01 | 76.6 | — | — | — | |
| Gemini-2.5-flashModel Category=Proprietary, Pass@1=true2026.03 | 75.88 | — | — | — | |
| Table-R1Model Category=Tuning-based, Pass@1=true2026.03 | 74.86 | — | — | — | |
| Deepseek-R1Model Category=Open-source, Pass@1=true2026.03 | 74.63 | — | — | — | |
| EnoTab2025.09 | 74.6 | — | — | — | |
| SynTQA (GPT)Base Model=GPT-3.5-Turbo2026.01 | 74.4 | — | — | — | |
| DP&AgentSelector=PieTa2024.12 | 74.15 | — | — | — | |
| H-Star2025.09 | 73.8 | — | — | — | |
| DP&AgentSelector=Holistic2024.12 | 73.6 | — | — | — | |
| Mix-SCBase Model=GPT-3.5-Turbo2026.01 | 73.6 | — | — | — | |
| TabLaP2025.09 | 72.8 | — | — | — | |
| Gemini-2.0-flashModel Category=Proprietary, Pass@1=true2026.03 | 72.54 | — | — | — | |
| Commented Reasoning FrameworkBase Model=Qwen2.5-Coder-14B-Instruct2026.01 | 72.1 | — | — | — | |
| SynTQA (RF)Base Model=GPT-3.5-Turbo2026.01 | 71.6 | — | — | — | |
| Commented Reasoning FrameworkBase Model=Qwen2.5-Coder-7B-Instruct2026.01 | 70.9 | — | — | — | |
| PoTableModel Category=Training-free, Pass@1=true2026.03 | 69.56 | — | — | — | |
| CABINETEvaluation Protocol=Our Method, # params=560 M2024.02 | 69.1 | — | — | — | |
| CABINETBase Model=Hybrid pipeline (no fixed LLM)2026.01 | 69.1 | — | — | — | |
| Qwen2.5-72B-InstructModel Category=Open-source, Pass@1=true2026.03 | 68.56 | — | — | — | |
| Chain-of-TableModel Category=Training-free, Pass@1=true2026.03 | 68.31 | — | — | — | |
| TableMasterBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 68.21 | — | — | — | |
| RepandaBase Model=DeepSeek-Coder-7B-Instruct-v1.52026.01 | 67.6 | — | — | — | |
| Chain-of-TableBase Model=GPT-3.5-Turbo2026.01 | 67.3 | — | — | — | |
| Chain-of-Table2025.09 | 67.1 | — | — | — | |
| Tab-PoTBase Model=GPT-3.5-Turbo2026.01 | 66.8 | — | — | — | |
| TabSQLify2025.09 | 66.4 | — | — | — | |
| DATEREvaluation Protocol=Few/zero shot Prompting of LLMs, # params=175 B2024.02 | 65.9 | — | — | — | |
| DATERbackbone=Codex2024.04 | 65.9 | — | — | — | |
| LEVEREvaluation Protocol=Few/zero shot Prompting of LLMs, # params=175 B2024.02 | 65.8 | — | — | — | |
| ReAcTablebackbone=Codex2024.04 | 65.8 | — | — | — | |
| PoTableBackbone=Llama-3.170B, Evaluation Protocol=Single inference run2025.01 | 65.56 | — | — | — | |
| OmniTabSelector=PieTa2024.12 | 64.78 | — | — | — | |
| PoTableBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 64.73 | — | — | — | |
| TabSQLifysub-table=col+row2024.04 | 64.7 | — | — | — | |
| TabSQLifyBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 64.7 | — | — | — | |
| BinderEvaluation Protocol=Few/zero shot Prompting of LLMs, # params=175 B2024.02 | 64.6 | — | — | — | |
| FlanT5-xlEvaluation Protocol=Fine-tuning text-based LLMs, # params=2.9 B2024.02 | 64.4 | — | — | — | |
| TabSQLifysub-table=row2024.04 | 63.7 | — | — | — | |
| GPT-3.5Selector=PieTa2024.12 | 63.65 | — | — | — | |
| OmniTabSelector=ITR2024.12 | 63.47 | — | — | — | |
| ITR2024.04 | 63.4 | — | — | — | |
| OmniTabSelector=Holistic2024.12 | 63.01 | — | — | — | |
| LEVER2024.04 | 62.9 | — | — | — | |
| OmniTabEvaluation Protocol=Fine-tuning Table-specific LLMs, # params=406 M2024.02 | 62.7 | — | — | — | |
| TableGPT2-7BModel Category=Tuning-based, Pass@1=true2026.03 | 62.46 | — | — | — | |
| Chain-of-TableBackbone=Llama-3.170B, Evaluation Protocol=Single inference run2025.01 | 62.22 | — | — | — | |
| TabSQLifysub-table=col2024.04 | 62 | — | — | — | |
| BINDERbackbone=Codex2024.04 | 61.9 | — | — | — | |
| NormTabTargeted + SQLNormalization Strategy=Targeted, Reasoning=SQL-based symbolic reasoning2024.06 | 61.2 | — | — | — | |
| Tree-of-TableBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 61.11 | — | — | — | |
| SQLbackbone=Codex2024.04 | 61.1 | — | — | — | |
| TaCubeEvaluation Protocol=Fine-tuning Table-specific LLMs, # params=406 M2024.02 | 60.8 | — | — | — | |
| NormTabBasic + SQLNormalization Strategy=Basic, Reasoning=SQL-based symbolic reasoning2024.06 | 60.8 | — | — | — | |
| GPT-3.5Selector=Holistic2024.12 | 60.75 | — | — | — | |
| Tab-CoTModel Category=Training-free, Pass@1=true2026.03 | 60.43 | — | — | — | |
| OmniTabSelector=TabSQLify2024.12 | 60.01 | — | — | — | |
| CABINETSelector=Holistic2024.12 | 60 | — | — | — | |
| Chain-of-TableSelector=Holistic2024.12 | 59.94 | — | — | — | |
| Chain-of-Table2024.06 | 59.94 | — | — | — | |
| Chain-of-TableBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 59.94 | — | — | — | |
| Chain-of-Table2024.04 | 59.9 | — | — | — | |
| GPT-3.5TabSelector=TabSQLify2024.12 | 59.71 | — | — | — | |
| GPT-3.5Selector=TabSQLify2024.12 | 59.21 | — | — | — | |
| GPT-3.5Selector=ITR2024.12 | 59.13 | — | — | — | |
| GPT-4.1Model Category=Proprietary, Pass@1=true2026.03 | 59.13 | — | — | — | |
| BinderBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 58.86 | — | — | — | |
| Binder2025.09 | 58.8 | — | — | — | |
| TaPExSelector=TabSQLify2024.12 | 58.75 | — | — | — | |
| ReasTAPEvaluation Protocol=Fine-tuning Table-specific LLMs, # params=406 M2024.02 | 58.6 | — | — | — | |
| DaterBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 58.33 | — | — | — | |
| Dater2025.09 | 58.3 | — | — | — | |
| Chain-of-Thought2025.09 | 58.2 | — | — | — | |
| TaPExSelector=PieTa2024.12 | 58.01 | — | — | — | |
| GPT-3.5Selector=Dater2024.12 | 57.78 | — | — | — | |
| OmniTabSelector=Dater2024.12 | 57.09 | — | — | — | |
| TabSQLifyBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 57.02 | — | — | — | |
| Rethinking-Tab-Data2024.06 | 56.87 | — | — | — | |
| TaPExSelector=ITR2024.12 | 56.86 | — | — | — | |
| BINDER2024.06 | 56.74 | — | — | — | |
| BinderBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 56.74 | — | — | — | |
| TaPExSelector=Holistic2024.12 | 56.54 | — | — | — | |
| TabSQLifyBackbone=Llama-3.170B, Evaluation Protocol=Single inference run2025.01 | 55.78 | — | — | — | |
| Chain-of-TableBackbone=gpt-4o-mini∼8B, Evaluation Protocol=Single inference run2025.01 | 55.6 | — | — | — | |
| TAPEXEvaluation Protocol=Fine-tuning Table-specific LLMs, # params=405 M2024.02 | 55.5 | — | — | — | |
| BINDERbackbone=chatgpt2024.04 | 55.4 | — | — | — | |
| BinderSelector=Holistic2024.12 | 55.4 | — | — | — | |
| SQLbackbone=chatgpt2024.04 | 54.1 | — | — | — | |
| DoTEvaluation Protocol=Fine-tuning Table-specific LLMs, # params=299 M2024.02 | 54 | — | — | — | |
| TaPExSelector=Dater2024.12 | 53.73 | — | — | — | |
| Chain-of-ThoughtBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 53.48 | — | — | — | |
| TableLlama-7BModel Category=Tuning-based, Pass@1=true2026.03 | 53.32 | — | — | — | |
| Text-to-SQLcontext=Rajkumar et al., 20222024.06 | 52.9 | — | — | — | |
| Text-to-SQLBackbone=gpt-3.5-turbo∼175B, Evaluation Protocol=Single inference run2025.01 | 52.9 | — | — | — |