Table Question Answering on WikiTQ
91.84AccuracyGPT-5-nano
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5-nanoWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 91.84 | |
| GPT-5-nanoWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 89.8 | |
| CRAFTBackbone=Qwen3.52026.06 | 86.1 | |
| GPT-oss-20bWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 85.71 | |
| GPT-oss-20bWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 85.71 | |
| Table-CriticBackbone=Qwen3.52026.06 | 85.4 | |
| CRAFT + CoTBackbone=Qwen3.52026.06 | 85.2 | |
| Formula-R1-PlusBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 82.54 | |
| GPT-4.1-nanoWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 81.63 | |
| Chain-of-TableBackbone=Qwen3.52026.06 | 80 | |
| TableMasterBackbone=GPT-4o-mini, Evaluation Protocol=Prompting-Based2025.05 | 78.13 | |
| SS-CoTBackbone=Llama-3.1 70B, Evaluation Protocol=Prompting-Based2025.05 | 76.8 | |
| DeepSeek-R1Setting=Others2025.11 | 75.76 | |
| TabClawCategory=Ours, Backbone=DeepSeek-v3.22026.06 | 75.2 | |
| TIDE DP&AgentBackbone=GPT-3.5, Evaluation Protocol=Prompting-Based2025.05 | 75 | |
| TabAFBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 74.72 | |
| Qwen2.5-CoderBase Model=Qwen2.5, Size=7B2025.05 | 74.5 | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen3, Size=8B2025.05 | 73.87 | |
| Norm-DP&AgentBackbone=GPT-3.5, Evaluation Protocol=Prompting-Based2025.05 | 73.65 | |
| SheetAgentCategory=Autonomous Agent, Backbone=DeepSeek-v3.22026.06 | 73.2 | |
| TableLLM (w/ SFT)Base Model=Qwen3, Size=8B2025.05 | 73.02 | |
| BinderCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 72.5 | |
| Chain-of-TableCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 72.1 | |
| TableGPT2Base Model=Qwen2.5, Size=72B2025.05 | 71.45 | |
| GPT-4.1-nanoWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 71.43 | |
| Few-shotBackbone=Qwen3.52026.06 | 71.4 | |
| QWQBase Model=Qwen2.5, Size=32B2025.05 | 70.5 | |
| Zero-shotBackbone=Qwen3.52026.06 | 70 | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 69.9 | |
| ReActCategory=Autonomous Agent, Backbone=DeepSeek-v3.22026.06 | 69.8 | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 69.6 | |
| Specialist SOTASetting=Others2025.11 | 69.1 | |
| RE-TableLLM (w/ RE-SFT)Base Model=Qwen3, Size=8B2025.05 | 69.06 | |
| Qwen2.5-InstructBase Model=Qwen2.5, Size=7B2025.05 | 68.55 | |
| GPT-4Setting=Others2025.11 | 68.4 | |
| GPT-4o2025.05 | 68.4 | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 68.2 | |
| VD-LB (HQ Correct vs. LQ Wrong)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 68.15 | |
| GPT-4.1Setting=Others2025.11 | 68.14 | |
| ReAcTableBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 68 | |
| Ministral-3-8BWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 67.35 | |
| CHAIN-OF-TABLELLM Backbone=PaLM 22024.01 | 67.31 | |
| Chain-of-TableBackbone=PaLM 2, Evaluation Protocol=Prompting-Based2025.05 | 67.31 | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 67.15 | |
| Formula-R1Backbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 67.05 | |
| BaselineModel=Qwen2.5-7B-VL, Training=Inference Only2026.03 | 66.4 | |
| TableLLMBase Model=CodeLlama, Size=13B2025.05 | 66.3 | |
| SpreadsheetLLMCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 66.1 | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=GQA2026.03 | 66.05 | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=HiTab2026.03 | 65.9 | |
| DaterBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 65.9 | |
| NormTabCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 65.9 | |
| VD-LF (HQ vs. LQ)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 65.4 | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=TeleChat2, Size=7B2025.05 | 65.27 | |
| BinderBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 64.6 | |
| TableLLM (w/ SFT)Base Model=Qwen2, Size=7B2025.05 | 64.16 | |
| RE-TableLLM (w/ RE-SFT)Base Model=TeleChat2, Size=7B2025.05 | 63.52 | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Llama3.1, Size=8B2025.05 | 63.51 | |
| TableLLM (w/ SFT)Base Model=TeleChat2, Size=7B2025.05 | 63.37 | |
| Ministral-3-8BWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 63.27 | |
| SFT (HQ Correct Only)Model=Qwen2.5-7B-VL, Train Set=VQA2026.03 | 62.85 | |
| OmniTabBackbone=BART-Large, Evaluation Protocol=Finetuning-Based2025.05 | 62.8 | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen2, Size=7B2025.05 | 61.69 | |
| DaterLLM Backbone=PaLM 22024.01 | 61.48 | |
| TableGPT2Backbone=Qwen 2.5 7B, Evaluation Protocol=Finetuning-Based2025.05 | 61.42 | |
| CFMSBackbone=GPT 3.52026.04 | 61.42 | |
| TableGPT2Base Model=Qwen2.5, Size=7B2025.05 | 61.42 | |
| VanillaCategory=Direct Inference, Backbone=DeepSeek-v3.22026.06 | 61.4 | |
| RE-TableLLM (w/ RE-SFT)Base Model=Llama3.1, Size=8B2025.05 | 61.03 | |
| End-to-End QALLM Backbone=PaLM 22024.01 | 60.59 | |
| Chain-of-ThoughtLLM Backbone=PaLM 22024.01 | 60.43 | |
| Few-Shot QALLM Backbone=PaLM 22024.01 | 60.33 | |
| CHAIN-OF-TABLELLM Backbone=GPT 3.52024.01 | 59.94 | |
| Chain-of-TableBackbone=GPT 3.52026.04 | 59.94 | |
| CHAIN-OF-TABLEBase Model=GPT3.52025.05 | 59.94 | |
| TAPEX-LargeBackbone=BART-Large, Evaluation Protocol=Finetuning-Based2025.05 | 59.1 | |
| QWEN3-8BWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=AS2026.01 | 58.16 | |
| RE-TableLLM (w/ RE-SFT)Base Model=Qwen2, Size=7B2025.05 | 57.55 | |
| Liu et al. (2021)Extra Pre-training=true2022.01 | 57.5 | |
| QWEN3-8BWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=AS2026.01 | 57.14 | |
| TAMOSetting=Frozen LLM, Backbone=Llama 3.1 8B2025.11 | 56.93 | |
| BinderLLM Backbone=GPT 3.52024.01 | 56.74 | |
| BinderBackbone=GPT 3.52026.04 | 56.74 | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen2.5, Size=3B2025.05 | 56.51 | |
| QWEN3-8BWorkflow=Chain-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 55.61 | |
| TableLLM (w/ SFT)Base Model=Qwen2.5, Size=3B2025.05 | 55.5 | |
| QWEN3-8BWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=RG (TABROUGE)2026.01 | 55.1 | |
| BinderLLM Backbone=PaLM 22024.01 | 54.88 | |
| Prompt tuningSetting=Frozen LLM, Backbone=Llama 3.1 8B2025.11 | 53.71 | |
| TableLLMBackbone=Qwen 7B, Evaluation Protocol=Finetuning-Based2025.05 | 53.59 | |
| Chain-of-ThoughtLLM Backbone=GPT 3.52024.01 | 53.48 | |
| Chain-of-ThoughtBackbone=GPT 3.52026.04 | 53.48 | |
| GPT-3.5Setting=Others2025.11 | 53.13 | |
| QWEN3-8BWorkflow=Tree-of-Table (Tools), ST Reward=true, SR Reward=AC2026.01 | 53.06 | |
| Text-to-SQLLLM Backbone=GPT 3.52024.01 | 52.9 | |
| Text-to-SQLBackbone=GPT 3.52026.04 | 52.9 | |
| DaterLLM Backbone=GPT 3.52024.01 | 52.81 | |
| DaterBackbone=GPT 3.52026.04 | 52.81 | |
| Few-Shot QALLM Backbone=GPT 3.52024.01 | 52.56 | |
| Few-Shot QABackbone=GPT 3.52026.04 | 52.56 |