Hierarchical Table Question Answering on HiTab
87.24AccuracyFormula-R1-Plus
Evaluation Results
| Method | Links | |
|---|---|---|
| Formula-R1-PlusBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 87.24 | |
| E5Backbone=GPT-4, Evaluation Protocol=Prompting-Based2025.05 | 85.08 | |
| SS-CoTBackbone=Llama-3.1 70B, Evaluation Protocol=Prompting-Based2025.05 | 79.1 | |
| TabAFBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 78.41 | |
| TableGPT2Backbone=Qwen 2.5 7B, Evaluation Protocol=Finetuning-Based2025.05 | 70.27 | |
| TabClawCategory=Ours, Backbone=DeepSeek-v3.22026.06 | 69.8 | |
| Formula-R1Backbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 69.74 | |
| API-AssistedBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 69.3 | |
| SheetAgentCategory=Autonomous Agent, Backbone=DeepSeek-v3.22026.06 | 69.1 | |
| BinderCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 65.8 | |
| SpreadsheetLLMCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 64.6 | |
| VanillaCategory=Direct Inference, Backbone=DeepSeek-v3.22026.06 | 63.6 | |
| Chain-of-TableCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 63.4 | |
| ReActCategory=Autonomous Agent, Backbone=DeepSeek-v3.22026.06 | 63.4 | |
| TableLlamaBackbone=Llama-2 7B, Evaluation Protocol=Finetuning-Based2025.05 | 60.48 | |
| NormTabCategory=Context Augmentation, Backbone=DeepSeek-v3.22026.06 | 60.3 | |
| FORTAPBackbone=BERT+LSTM, Evaluation Protocol=Finetuning-Based2025.05 | 47 | |
| TAPEX-LargeBackbone=BART-Large, Evaluation Protocol=Finetuning-Based2025.05 | 45.6 | |
| TableLLMBackbone=Qwen 7B, Evaluation Protocol=Finetuning-Based2025.05 | 43.88 |