Table Question Answering on VTabFact (test)
91.6AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oModel Scale=Large Scale2026.06 | 91.6 | |
| IAPOModel Scale=Small Scale, Backbone=Qwen-2.5VL-3B2026.06 | 72.1 | |
| ToRLModel Scale=Small Scale, Backbone=Qwen-2.5VL-3B2026.06 | 71 | |
| TRMModel Scale=Small Scale, Backbone=Qwen-2.5VL-3B2026.06 | 70.9 | |
| VTool-R1 (GRPO)Model Scale=Small Scale, Backbone=Qwen-2.5VL-3B2026.06 | 70.5 | |
| VTool-R1 (GRPO)Model Scale=Large Scale, Backbone=Qwen-2.5VL-7B2026.06 | 69.1 | |
| Qwen-2.5VL-7BModel Scale=Large Scale2026.06 | 45.6 | |
| Qwen-2.5VL-3BModel Scale=Small Scale2026.06 | 36.8 |