Question Answering on TAT-QA (held-out)
59.33AccuracyClaude-3.5-Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-3.5-SonnetResolution=UNK2025.09 | 59.33 | |
| Gemini-2.5-ProResolution=UNK2025.09 | 56.29 | |
| OpenAI-o4-miniResolution=UNK2025.09 | 56.16 | |
| QVQ-72B-PreviewResolution=Dyn.2025.09 | 55.48 | |
| GPT-4oResolution=UNK2025.09 | 53.85 | |
| Qwen2-VL-72BResolution=Dyn.2025.09 | 52.23 | |
| Qwen2-VL-7B-GRPOResolution=Dyn.2025.09 | 51.68 | |
| Qwen2-VL-7B-Table-R1Resolution=Dyn.2025.09 | 48.06 | |
| Qwen2-VL-7BResolution=Dyn.2025.09 | 46.5 | |
| Qwen2-VL-7B-SFTResolution=Dyn.2025.09 | 37.82 | |
| Qwen2-VL-2BResolution=Dyn.2025.09 | 30.44 | |
| Qwen2-VL-2B-GRPOResolution=Dyn.2025.09 | 29.02 | |
| Qwen2-VL-2B-Table-R1Resolution=Dyn.2025.09 | 26.42 | |
| DeepSeek-VL2 4.5BResolution=Dyn.2025.09 | 24.11 | |
| Qwen2-VL-7B-InsResolution=Dyn2025.09 | 20.85 | |
| Qwen2-VL-2B-SFTResolution=Dyn.2025.09 | 19.69 | |
| Table-LLaVA 13BResolution=336, Trained on dataset=true2025.09 | 15.67 | |
| Table-LLaVA 7BResolution=336, Trained on dataset=true2025.09 | 12.82 | |
| Monkey 7BResolution=8962025.09 | 12.31 | |
| LLaVA-v1.5 7BResolution=3362025.09 | 2.97 | |
| mPLUG-Owl2 7BResolution=4482025.09 | 0.39 |