Text-oriented Visual Question Answering on WTQ
71.3AccuracyVisual-SR1
Evaluation Results
| Method | Links | |
|---|---|---|
| Visual-SR1Backbone=Qwen2.5-VL-7B2025.09 | 71.3 | |
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | 63.7 | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | 62.3 | |
| ViCropBackbone=LLaVA-1.5 (Vicuna-7B)2025.09 | 51.5 | |
| DeepEyesBackbone=Qwen2.5-VL-7B2025.09 | 51.3 | |
| GRITBackbone=Qwen2.5-VL-3B2025.09 | 32 | |
| HRVDAResolution=15362024.04 | 31.2 | |
| UReaderResolution=2242024.04 | 29.4 | |
| mPLUG-DocResolution=2242024.04 | 26.9 | |
| SeRumResolution=1280, Fine-tuning=true2024.04 | 25.5 | |
| DonutResolution=1280, Fine-tuning=true2024.04 | 18.8 | |
| Qwen-VLResolution=448, Open-source evaluation=true2024.04 | 16.1 |