Program of Thought Reasoning on TableBench
51.96Rge ScoreGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oModel Scale Group=Larger2025.12 | 51.96 | |
| Qwen-PlusModel Scale Group=Larger2025.12 | 41.79 | |
| QwQ-32BModel Scale Group=Larger2025.12 | 40.03 | |
| TableGPT2-7BModel Scale Group=Comparable2025.12 | 39.8 | |
| Qwen3-32BModel Scale Group=Larger2025.12 | 37.78 | |
| Qwen3-14BModel Scale Group=Larger2025.12 | 36.61 | |
| TableGPT-R1-8BModel Scale Group=Comparable2025.12 | 35.12 | |
| DeepSeek-V3Model Scale Group=Larger2025.12 | 33.05 | |
| Qwen3-8BModel Scale Group=Comparable2025.12 | 28.01 | |
| Qwen3-72BModel Scale Group=Larger2025.12 | 27.72 | |
| Table-R1-Zero-7BModel Scale Group=Comparable2025.12 | 7.54 | |
| Llama-3.1-8BModel Scale Group=Comparable2025.12 | 6.73 | |
| TableLLMModel Scale Group=Comparable2025.12 | 0 |