Numerical Reasoning on TableBench (test)
64.48AccuracyQwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-8BStrategy=TGN2026.05 | 64.48 | |
| Qwen3-4BStrategy=SCoT2026.05 | 61.46 | |
| DeepSeek-R1-Distill-Llama-8BStrategy=PIP2026.05 | 50.13 | |
| Qwen3-1.7BStrategy=PIP2026.05 | 43.83 | |
| TableLLM-Qwen2-7BStrategy=PIP2026.05 | 38.54 | |
| Qwen2.5-Coder-7B-InstructStrategy=CoT2026.05 | 37.03 | |
| TableGPT2-7BStrategy=PIP2026.05 | 31.23 | |
| Qwen2.5-7B-InstructStrategy=CoT2026.05 | 25.69 | |
| Qwen2-7B-InstructStrategy=PIP2026.05 | 24.69 | |
| Meta-Llama-3-8B-InstructStrategy=ReAct2026.05 | 21.91 | |
| Llama-3.1-8B-InstructStrategy=ReAct2026.05 | 13.85 | |
| Llama-3.2-3B-InstructStrategy=DP2026.05 | 4.03 | |
| Llama-3.2-3B-InstructStrategy=TGN2026.05 | 3.78 |