Table Question Answering on WikiSQL
92.07AccuracySpecialist SOTA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Specialist SOTASetting=Others2025.11 | 92.07 | — | — | |
| GRABSetting=Tuned LLM (LoRA)2026.06 | 90.23 | — | — | |
| zero-shotSetting=Tuned LLM (LoRA)2026.06 | 90.17 | — | — | |
| GRABSetting=Frozen LLM2026.06 | 88.3 | — | — | |
| TableLLamaSetting=Others2026.06 | 87.37 | — | — | |
| TAMOSetting=Frozen LLM2026.06 | 86.29 | — | — | |
| TAMO+Setting=Tuned LLM (SFT)2025.11 | 85.9 | — | — | |
| Prompt tuningSetting=Frozen LLM2026.06 | 85.71 | — | — | |
| TAMOSetting=Frozen LLM, Backbone=Llama 3.1 8B2025.11 | 85.44 | — | — | |
| TAMO+Setting=Tuned LLM (LoRA)2025.11 | 84.43 | — | — | |
| SFTSetting=Tuned LLM (SFT)2025.11 | 79.86 | — | — | |
| Prompt tuningSetting=Frozen LLM, Backbone=Llama 3.1 8B2025.11 | 77.06 | — | — | |
| TAMOSetting=Frozen LLM2025.11 | 76.45 | — | — | |
| GPT-5.4-miniSetting=Others2026.06 | 72.99 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen3, Size=8B2025.05 | 72.5 | — | — | |
| DeepSeek-R1Setting=Others2025.11 | 71.91 | — | — | |
| GPT-4.1Setting=Others2025.11 | 71.21 | — | — | |
| TableLLM (w/ SFT)Base Model=Qwen3, Size=8B2025.05 | 71.14 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=Qwen3, Size=8B2025.05 | 69.57 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=TeleChat2, Size=7B2025.05 | 66.12 | — | — | |
| TableLLM (w/ SFT)Base Model=TeleChat2, Size=7B2025.05 | 65.58 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=TeleChat2, Size=7B2025.05 | 64.93 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen2, Size=7B2025.05 | 64.8 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=Qwen2, Size=7B2025.05 | 64.42 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Llama3.1, Size=8B2025.05 | 64.3 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=Qwen2.5, Size=3B2025.05 | 63.98 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=Llama3.1, Size=8B2025.05 | 62.92 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=Qwen2.5, Size=3B2025.05 | 61.55 | — | — | |
| TableLLM (w/ SFT)Base Model=Qwen2.5, Size=3B2025.05 | 61.46 | — | — | |
| Prompt tuningSetting=Frozen LLM2025.11 | 61.24 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=DS-Coder, Size=7B2025.05 | 60.45 | — | — | |
| Table-R1 (w/ RE-SFT & TARPO)Base Model=CodeQwen, Size=7B2025.05 | 59.89 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=DS-Coder, Size=7B2025.05 | 58.86 | — | — | |
| RE-TableLLM (w/ RE-SFT)Base Model=CodeQwen, Size=7B2025.05 | 57.35 | — | — | |
| TableGPT2Base Model=Qwen2.5, Size=72B2025.05 | 57.32 | — | — | |
| LoRASetting=Tuned LLM (LoRA)2025.11 | 57.1 | — | — | |
| zero-shotSetting=Inference-only2026.06 | 53.86 | — | — | |
| TableGPT2Base Model=Qwen2.5, Size=7B2025.05 | 53.74 | — | — | |
| QWQBase Model=Qwen2.5, Size=32B2025.05 | 47.67 | — | — | |
| GPT-4Setting=Others2025.11 | 47.6 | — | — | |
| GPT-4o2025.05 | 47.6 | — | — | |
| Qwen2.5-InstructBase Model=Qwen2.5, Size=7B2025.05 | 47.42 | — | — | |
| Qwen2.5-CoderBase Model=Qwen2.5, Size=7B2025.05 | 46.9 | — | — | |
| TableLLM (w/ SFT)Base Model=Qwen2, Size=7B2025.05 | 46.5 | — | — | |
| TableLlamaSetting=Tuned LLM (SFT)2025.11 | 46.26 | — | — | |
| CHAIN-OF-TABLEBase Model=GPT3.52025.05 | 43.72 | — | — | |
| GPT-3.5Setting=Others2025.11 | 41.91 | — | — | |
| TableLLMBase Model=CodeLlama, Size=13B2025.05 | 41.1 | — | — | |
| TableLLM (w/ SFT)Base Model=Llama3.1, Size=8B2025.05 | 39 | — | — | |
| DS-liteBase Model=DS-Coder, Size=16B2025.05 | 38.3 | — | — | |
| TableLLM (w/ SFT)Base Model=CodeQwen, Size=7B2025.05 | 37.2 | — | — | |
| TableLLM (w/ SFT)Base Model=DS-Coder, Size=7B2025.05 | 36.14 | — | — | |
| Llama 3.1 8BSetting=Inference Only2025.11 | 31.6 | — | — | |
| Yi-CoderBase Model=Yi, Size=9B2025.05 | 25.34 | — | — | |
| Zero-shotSetting=Inference Only2025.11 | 21.44 | — | — | |
| BARTMode=Text Baseline2023.05 | — | 85.8 | — | |
| CRAFTQA2026.06 | — | — | 86.1 | |
| Dublinfixed_resResolution=fixed2023.05 | — | 75.3 | — | |
| Dublinvariable_resResolution=variable2023.05 | — | 75.3 | — | |
| PoT2026.06 | — | — | 44.42 | |
| Readi2026.06 | — | — | 64.7 | |
| StructGPT2026.06 | — | — | 57.9 | |
| TAPEXPipeline=specialized2023.05 | — | 89.2 | — | |
| TrustUQA2026.06 | — | — | 85.7 |