Fact Checking on TableBench (test)
85.42AccuracyQwen3-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-4BStrategy=SCoT2026.05 | 85.42 | |
| Qwen3-8BStrategy=TGN2026.05 | 85.42 | |
| Qwen3-8BStrategy=ReAct2026.05 | 84.38 | |
| Qwen3-4BStrategy=TGN2026.05 | 82.29 | |
| Qwen3-8BStrategy=SCoT2026.05 | 82.29 | |
| Qwen3-8BStrategy=SelfAsk2026.05 | 82.29 | |
| Qwen3-8BStrategy=PIP2026.05 | 82.29 | |
| Qwen3-4BStrategy=DP2026.05 | 81.25 | |
| Qwen3-4BStrategy=CoT2026.05 | 81.25 | |
| Qwen3-4BStrategy=ReAct2026.05 | 79.17 | |
| Qwen3-8BStrategy=DP2026.05 | 79.17 | |
| Qwen3-8BStrategy=CoT2026.05 | 78.12 | |
| Qwen3-4BStrategy=SelfAsk2026.05 | 77.08 | |
| Qwen3-4BStrategy=ToT2026.05 | 76.04 | |
| Qwen3-4BStrategy=PIP2026.05 | 76.04 | |
| Qwen3-8BStrategy=ToT2026.05 | 75 | |
| Qwen2.5-Coder-7B-InstructStrategy=CoT2026.05 | 73.96 | |
| Qwen2.5-Coder-7B-InstructStrategy=TGN2026.05 | 70.83 | |
| Qwen2-7B-InstructStrategy=PIP2026.05 | 69.79 | |
| TableLLM-CodeQwen-7BStrategy=PIP2026.05 | 68.75 | |
| Qwen2.5-Coder-7B-InstructStrategy=ToT2026.05 | 67.71 | |
| Qwen2.5-Coder-7B-InstructStrategy=PIP2026.05 | 67.71 | |
| TableLLM-CodeQwen-7BStrategy=SelfAsk2026.05 | 67.71 | |
| TableLLM-CodeQwen-7BStrategy=TGN2026.05 | 67.71 | |
| TableLLM-Llama3.1-8BStrategy=SelfAsk2026.05 | 67.71 | |
| TableLLM-Qwen2-7BStrategy=CoT2026.05 | 67.71 | |
| TableLLM-CodeQwen-7BStrategy=ToT2026.05 | 66.67 | |
| TableLLM-DeepseekCoder-7BStrategy=CoT2026.05 | 66.67 | |
| TableLLM-DeepseekCoder-7BStrategy=TGN2026.05 | 65.96 | |
| Qwen2.5-Coder-7B-InstructStrategy=ReAct2026.05 | 65.62 | |
| TableLLM-Llama3.1-8BStrategy=ToT2026.05 | 65.62 | |
| TableLLM-Llama3.1-8BStrategy=PIP2026.05 | 65.62 | |
| TableLLM-CodeQwen-7BStrategy=DP2026.05 | 64.58 | |
| TableLLM-DeepseekCoder-7BStrategy=SCoT2026.05 | 64.58 | |
| TableLLM-Llama3.1-8BStrategy=DP2026.05 | 64.58 | |
| TableLLM-Llama3.1-8BStrategy=TGN2026.05 | 64.58 | |
| TableLLM-Qwen2-7BStrategy=ReAct2026.05 | 64.58 | |
| Qwen2-7B-InstructStrategy=ReAct2026.05 | 63.54 | |
| Qwen2.5-Coder-7B-InstructStrategy=SCoT2026.05 | 63.54 | |
| TableLLM-DeepseekCoder-7BStrategy=ToT2026.05 | 63.54 | |
| TableLLM-Llama3-8BStrategy=SCoT2026.05 | 63.54 | |
| TableLLM-Llama3-8BStrategy=SelfAsk2026.05 | 63.54 | |
| TableLLM-Llama3.1-8BStrategy=ReAct2026.05 | 63.54 | |
| TableLLM-Qwen2-7BStrategy=PIP2026.05 | 63.54 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=ReAct2026.05 | 62.5 | |
| Meta-Llama-3-8B-InstructStrategy=PIP2026.05 | 62.5 | |
| TableLLM-Llama3-8BStrategy=ReAct2026.05 | 62.5 | |
| TableLLM-Llama3-8BStrategy=ToT2026.05 | 62.5 | |
| TableLLM-Qwen2-7BStrategy=DP2026.05 | 62.5 | |
| Qwen2-7B-InstructStrategy=SCoT2026.05 | 61.46 | |
| Qwen3-1.7BStrategy=ReAct2026.05 | 61.46 | |
| TableLLM-DeepseekCoder-7BStrategy=PIP2026.05 | 61.46 | |
| TableLLM-Llama3-8BStrategy=CoT2026.05 | 61.46 | |
| TableLLM-Llama3-8BStrategy=PIP2026.05 | 61.46 | |
| TableLLM-Llama3.1-8BStrategy=CoT2026.05 | 61.46 | |
| TableLLM-Qwen2-7BStrategy=ToT2026.05 | 61.46 | |
| TableLLM-Qwen2-7BStrategy=TGN2026.05 | 61.46 | |
| Qwen2-7B-InstructStrategy=TGN2026.05 | 60.42 | |
| TableLLM-DeepseekCoder-7BStrategy=ReAct2026.05 | 60.42 | |
| TableLLM-DeepseekCoder-7BStrategy=SelfAsk2026.05 | 60.42 | |
| TableLLM-Llama3-8BStrategy=TGN2026.05 | 60.42 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=SCoT2026.05 | 59.38 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=PIP2026.05 | 59.38 | |
| Meta-Llama-3-8B-InstructStrategy=DP2026.05 | 59.38 | |
| Qwen2.5-Coder-7B-InstructStrategy=SelfAsk2026.05 | 59.38 | |
| Qwen3-1.7BStrategy=DP2026.05 | 59.38 | |
| TableLLM-CodeQwen-7BStrategy=SCoT2026.05 | 59.38 | |
| TableLLM-DeepseekCoder-7BStrategy=DP2026.05 | 59.38 | |
| TableLLM-Llama3-8BStrategy=DP2026.05 | 59.38 | |
| TableLLM-Qwen2-7BStrategy=SCoT2026.05 | 59.38 | |
| Qwen2.5-7B-InstructStrategy=TGN2026.05 | 58.33 | |
| Qwen3-1.7BStrategy=CoT2026.05 | 57.29 | |
| TableLLM-CodeQwen-7BStrategy=CoT2026.05 | 57.29 | |
| Meta-Llama-3-8B-InstructStrategy=SCoT2026.05 | 56.25 | |
| Meta-Llama-3-8B-InstructStrategy=SelfAsk2026.05 | 56.25 | |
| Qwen2.5-7B-InstructStrategy=CoT2026.05 | 56.25 | |
| Llama-3.1-8B-InstructStrategy=SCoT2026.05 | 55.21 | |
| Meta-Llama-3-8B-InstructStrategy=ReAct2026.05 | 55.21 | |
| Qwen2.5-7B-InstructStrategy=DP2026.05 | 55.21 | |
| Qwen3-1.7BStrategy=SCoT2026.05 | 55.21 | |
| TableLLM-Llama3.1-8BStrategy=SCoT2026.05 | 55.21 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=ToT2026.05 | 54.17 | |
| Qwen2.5-Coder-7B-InstructStrategy=DP2026.05 | 54.17 | |
| TableGPT2-7BStrategy=SelfAsk2026.05 | 54.17 | |
| TableGPT2-7BStrategy=PIP2026.05 | 53.12 | |
| Meta-Llama-3-8B-InstructStrategy=ToT2026.05 | 52.08 | |
| Qwen2.5-7B-InstructStrategy=SelfAsk2026.05 | 52.08 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=CoT2026.05 | 51.04 | |
| Llama-3.1-8B-InstructStrategy=DP2026.05 | 51.04 | |
| Qwen2.5-7B-InstructStrategy=PIP2026.05 | 51.04 | |
| Qwen3-1.7BStrategy=PIP2026.05 | 51.04 | |
| Meta-Llama-3-8B-InstructStrategy=TGN2026.05 | 50 | |
| Qwen2.5-7B-InstructStrategy=SCoT2026.05 | 50 | |
| Qwen2-7B-InstructStrategy=SelfAsk2026.05 | 48.96 | |
| TableGPT2-7BStrategy=CoT2026.05 | 48.96 | |
| Llama-3.1-8B-InstructStrategy=PIP2026.05 | 47.92 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=SelfAsk2026.05 | 46.88 | |
| Qwen2-7B-InstructStrategy=DP2026.05 | 46.88 | |
| Llama-3.1-8B-InstructStrategy=ReAct2026.05 | 45.83 | |
| Qwen3-1.7BStrategy=TGN2026.05 | 45.83 |