Table Question Answering on ReasonTabQA 1.0 (test)
67.58AccuracyGemini-3-Pro-Preview
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3-Pro-PreviewReasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 67.58 | |
| Claude-Opus-4.5Reasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 66.2 | |
| Doubao-1.5-thinking-proReasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 64.48 | |
| Qwen3-8B-Think-SFT-TabCodeRLReasoning Mode=thinking, Model Category=Table-Specific Models2026.01 | 61.89 | |
| Qwen3-32B-InstructReasoning Mode=thinking, Model Category=Reasoning Models2026.01 | 58.76 | |
| GPT-4oReasoning Mode=No reasoning, Model Category=No reasoning Models2026.01 | 56.9 | |
| Deepseek-R1Reasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 55.8 | |
| OpenAI o1-miniReasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 55.8 | |
| QWQ-32BReasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 54.1 | |
| Qwen2.5-72B-InstructReasoning Mode=No reasoning, Model Category=No reasoning Models2026.01 | 51.92 | |
| Qwen3-8B-InstructReasoning Mode=thinking, Model Category=Reasoning Models2026.01 | 49.87 | |
| TableGPT2-7BReasoning Mode=Table-Specific, Model Category=Table-Specific Models2026.01 | 42.05 | |
| Qwen3-8B-InstructReasoning Mode=no-thinking, Model Category=No reasoning Models2026.01 | 40.97 | |
| Llama-3.1-8B-InstructReasoning Mode=No reasoning, Model Category=No reasoning Models2026.01 | 33.24 | |
| TableLLM-7BReasoning Mode=Table-Specific, Model Category=Table-Specific Models2026.01 | 13.5 | |
| TableLlama-7BReasoning Mode=Table-Specific, Model Category=Table-Specific Models2026.01 | 13.23 | |
| Deepseek-R1-Distill-Qwen-7BReasoning Mode=Reasoning Models, Model Category=Reasoning Models2026.01 | 11.86 |