Table Fact Verification on TabFact
0.953AccuracyCRAFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CRAFTBackbone=Qwen3.52026.06 | 0.953 | — | — | — | |
| Formula-R1-PlusBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.9506 | — | — | — | |
| CRAFT + CoTBackbone=Qwen3.52026.06 | 0.943 | — | — | — | |
| Table-CriticBackbone=Qwen3.52026.06 | 0.939 | — | — | — | |
| Chain-of-TableBackbone=Qwen3.52026.06 | 0.937 | — | — | — | |
| Qwen2-72B-InstructScale=72B, Modality=Text2025.02 | 0.9168 | 0.5711 | — | — | |
| Qwen3-VL-8B + TABQAWORLDStrategy=Training-free Agent2026.04 | 0.9145 | — | — | — | |
| CIT-DPStrategy=Training-free Agent, Backbone=GPT3.52026.04 | 0.913 | — | — | — | |
| TabTrim-8BStrategy=Trained Trajectory Optimization2026.04 | 0.912 | — | — | — | |
| TableMasterBackbone=GPT-4o-mini, Evaluation Protocol=Prompting-Based2025.05 | 0.9012 | — | — | — | |
| TIDE DP&AgentBackbone=GPT-3.5, Evaluation Protocol=Prompting-Based2025.05 | 0.8982 | — | — | — | |
| TIDEStrategy=Training-free Agent, Backbone=GPT3.52026.04 | 0.8982 | — | — | — | |
| DataFactoryBackbone LLM=Gemini 2.5 Flash2026.03 | 0.896 | — | 0.84 | 9.26 | |
| TabTrim-4BStrategy=Trained Trajectory Optimization2026.04 | 0.894 | — | — | — | |
| Norm-DP&AgentBackbone=GPT-3.5, Evaluation Protocol=Prompting-Based2025.05 | 0.885 | — | — | — | |
| Mix-SCStrategy=Training-free Agent, Backbone=GPT3.52026.04 | 0.885 | — | — | — | |
| Zero-shotBackbone=Qwen3.52026.06 | 0.88 | — | — | — | |
| GPT-4oScale=N/A, Modality=Image & Text2025.02 | 0.8762 | 0.5558 | — | — | |
| Few-shotBackbone=Qwen3.52026.06 | 0.869 | — | — | — | |
| Chain-of-TableBackbone=PaLM 2, Evaluation Protocol=Prompting-Based2025.05 | 0.8661 | — | — | — | |
| ReAcTableBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 0.861 | — | — | — | |
| ReAcTableStrategy=Training-free Agent, Backbone=GPT3.52026.04 | 0.861 | — | — | — | |
| DaterBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 0.856 | — | — | — | |
| DATERStrategy=Training-free Agent, Backbone=GPT3.52026.04 | 0.856 | — | — | — | |
| BinderBackbone=CodeX, Evaluation Protocol=Prompting-Based2025.05 | 0.851 | — | — | — | |
| Formula-R1Backbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.8508 | — | — | — | |
| Qwen2.5-VL-7B + TABQAWORLDStrategy=Training-free Agent2026.04 | 0.8442 | — | — | — | |
| TAPEX-LargeBackbone=BART-Large, Evaluation Protocol=Finetuning-Based2025.05 | 0.842 | — | — | — | |
| TabAFBackbone=Qwen 2.5-Coder 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.8399 | — | — | — | |
| GPT-4o (Image Only)Scale=N/A, Modality=Image2025.02 | 0.8345 | 0.5426 | — | — | |
| Qwen2.5-VL-InstructScale=7B, Modality=Image & Text2025.02 | 0.8343 | 0.5858 | — | — | |
| Qwen2.5-InstructScale=7B, Modality=Text2025.02 | 0.8308 | 0.6154 | — | — | |
| TableLlama + OracleScale=7B, Modality=Text2025.02 | 0.8255 | 0.5533 | — | — | |
| TableLlamaBackbone=Llama-2 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.8255 | — | — | — | |
| MiniCPM-V-2.6 + Vanilla SFTScale=8B, Modality=Image & Text2025.02 | 0.8254 | 0.6193 | — | — | |
| Qwen2.5-VL-Instruct + HIPPOScale=7B, Modality=Image & Text2025.02 | 0.8251 | 0.629 | — | — | |
| Qwen3-VL-8BModality=Image2026.04 | 0.8241 | — | — | — | |
| MiniCPM-V-2.6 + HIPPOScale=8B, Modality=Image & Text2025.02 | 0.8227 | 0.6546 | — | — | |
| HIPPO-8BModality=Multimodal2026.04 | 0.8227 | — | — | — | |
| DataFactoryBackbone LLM=Deepseek V32026.03 | 0.822 | — | 0.84 | 9.26 | |
| TAPEX-large2026.03 | 0.82 | — | 0.82 | 1.33 | |
| Qwen2.5-VL-Instruct (Image Only)Scale=7B, Modality=Image2025.02 | 0.8144 | 0.5685 | — | — | |
| TableDART (TG2-7B+Ovis2-8B)Strategy=Dynamic Adaptive Routing2026.04 | 0.8137 | — | — | — | |
| Gemini 2.0 FlashModality=Multimodal2026.04 | 0.8133 | — | — | — | |
| Ovis2-8B (Image-only Path)Strategy=Dynamic Adaptive Routing2026.04 | 0.808 | — | — | — | |
| AutoPrepBackbone LLM=Deepseek V32026.03 | 0.807 | — | 0.773 | 2.96 | |
| DocOwl-1.5Trainable Parameters=8.1B2026.02 | 0.804 | — | — | — | |
| TAPAS-large2026.03 | 0.801 | — | 0.801 | 3.25 | |
| DataFactoryBackbone LLM=GPT-4o mini2026.03 | 0.801 | — | 0.84 | 9.26 | |
| Qwen2.5-VL-Instruct + Vanilla SFTScale=7B, Modality=Image & Text2025.02 | 0.8008 | 0.6215 | — | — | |
| TableCoTBackbone LLM=Deepseek V32026.03 | 0.798 | — | 0.605 | 16.99 | |
| TableLlama + MarkdownScale=7B, Modality=Text2025.02 | 0.7937 | 0.3786 | — | — | |
| TableLlama-7BModality=Text2026.04 | 0.7937 | — | — | — | |
| MiniCPM-V-2.6Scale=8B, Modality=Image & Text2025.02 | 0.7931 | 0.6212 | — | — | |
| Few-ShotBackbone LLM=Deepseek V32026.03 | 0.792 | — | 0.69 | 16.03 | |
| MiniCPM-V-2.6 (Image Only)Scale=8B, Modality=Image2025.02 | 0.7848 | 0.6042 | — | — | |
| MiniCPM-V-2.6-8BModality=Image2026.04 | 0.7848 | — | — | — | |
| TabSQLifyBackbone LLM=GPT-4o mini2026.03 | 0.783 | — | 0.756 | 6.9 | |
| TableDART (TG2-7B+Qwen2.5-VL-7B)Strategy=Dynamic Adaptive Routing2026.04 | 0.7794 | — | — | — | |
| TableGPT2Backbone=Qwen 2.5 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.778 | — | — | — | |
| TableGPT2-7B (Text-only Path)Strategy=Dynamic Adaptive Routing2026.04 | 0.778 | — | — | — | |
| Llama3.1-InstructScale=8B, Modality=Text2025.02 | 0.7757 | 0.3542 | — | — | |
| AutoPrepBackbone LLM=Gemini 2.5 Flash2026.03 | 0.766 | — | 0.773 | 2.96 | |
| End-to-EndBackbone LLM=Deepseek V32026.03 | 0.76 | — | 0.736 | 7.27 | |
| Qwen2.5-VL-7BModality=Image2026.04 | 0.7581 | — | — | — | |
| End-to-EndBackbone LLM=Gemini 2.5 Flash2026.03 | 0.753 | — | 0.736 | 7.27 | |
| Table-LLaVA + HIPPOScale=7B, Modality=Image & Text2025.02 | 0.7466 | 0.5552 | — | — | |
| AutoPrepBackbone LLM=GPT-4o mini2026.03 | 0.746 | — | 0.773 | 2.96 | |
| TabSQLifyBackbone LLM=Deepseek V32026.03 | 0.745 | — | 0.756 | 6.9 | |
| ReAcTableBackbone LLM=Gemini 2.5 Flash2026.03 | 0.74 | — | 0.705 | 9.9 | |
| TabSQLifyBackbone LLM=Gemini 2.5 Flash2026.03 | 0.739 | — | 0.756 | 6.9 | |
| Llama3-InstructScale=8B, Modality=Text2025.02 | 0.7389 | 0.3198 | — | — | |
| Llama3-Instruct-8BModality=Text2026.04 | 0.7389 | — | — | — | |
| MACTBackbone LLM=Gemini 2.5 Flash2026.03 | 0.729 | — | 0.597 | 14.47 | |
| HRVDATrainable Parameters=7.1B2026.02 | 0.723 | — | — | — | |
| SynTab-LLaVA-7BModality=Image2026.04 | 0.7078 | — | — | — | |
| TableLLMBackbone=Qwen 7B, Evaluation Protocol=Finetuning-Based2025.05 | 0.6981 | — | — | — | |
| Table-LLaVAScale=7B, Modality=Image & Text2025.02 | 0.6942 | 0.5098 | — | — | |
| End-to-EndBackbone LLM=GPT-4o mini2026.03 | 0.694 | — | 0.736 | 7.27 | |
| ReAcTableBackbone LLM=GPT-4o mini2026.03 | 0.694 | — | 0.705 | 9.9 | |
| ReAcTableBackbone LLM=Deepseek V32026.03 | 0.681 | — | 0.705 | 9.9 | |
| DocOwlTrainable Parameters=7.3B2026.02 | 0.676 | — | — | — | |
| UReaderTrainable Parameters=7.1B2026.02 | 0.676 | — | — | — | |
| Table-LLaVA (Image Only)Scale=13B, Modality=Image2025.02 | 0.65 | 0.3809 | — | — | |
| StructGPTBackbone LLM=Gemini 2.5 Flash2026.03 | 0.644 | — | 0.594 | 13.53 | |
| Few-ShotBackbone LLM=GPT-4o mini2026.03 | 0.642 | — | 0.69 | 16.03 | |
| Few-ShotBackbone LLM=Gemini 2.5 Flash2026.03 | 0.636 | — | 0.69 | 16.03 | |
| PositionOCRTrainable Parameters=131M2026.02 | 0.628 | — | — | — | |
| Table-LLaVA (Image Only)Scale=7B, Modality=Image2025.02 | 0.5985 | 0.3569 | — | — | |
| Table-LLaVA-7BModality=Image2026.04 | 0.5985 | — | — | — | |
| MACTBackbone LLM=Deepseek V32026.03 | 0.589 | — | 0.597 | 14.47 | |
| DS-Q14B + TATTOO (Qwen3-8B)Strategy=Trained Trajectory Optimization2026.04 | 0.5879 | — | — | — | |
| StructGPTBackbone LLM=GPT-4o mini2026.03 | 0.584 | — | 0.594 | 13.53 | |
| DS + Qwen2.5-Math-PRM-72BStrategy=Trained Trajectory Optimization2026.04 | 0.579 | — | — | — | |
| StructGPTBackbone LLM=Deepseek V32026.03 | 0.556 | — | 0.594 | 13.53 | |
| DonutTrainable Parameters=176M2026.02 | 0.546 | — | — | — | |
| TableCoTBackbone LLM=GPT-4o mini2026.03 | 0.51 | — | 0.605 | 16.99 | |
| TableCoTBackbone LLM=Gemini 2.5 Flash2026.03 | 0.506 | — | 0.605 | 16.99 | |
| TabPediaScale=7B, Modality=Image2025.02 | 0.5053 | 0.2084 | — | — | |
| MACTBackbone LLM=GPT-4o mini2026.03 | 0.474 | — | 0.597 | 14.47 |