Visual Question Answering on TextVQA v1.0 (test)
86.79AccuracyHuman
Evaluation Results
| Method | Links | |
|---|---|---|
| Human2019.04 | 86.79 | |
| Entropy-Gradient GroundingTraining Approach=Training-free, VLM=Qwen 2.5 VL2026.04 | 81.45 | |
| Base modelTraining Approach=Training-free, VLM=Qwen 2.5 VL2026.04 | 80.75 | |
| Entropy-Gradient GroundingTraining Approach=Training-free, VLM=InternVL 3.52026.04 | 74.29 | |
| TEVA 7BTraining Approach=Training-based, VLM=TEVA2026.04 | 72.5 | |
| ViCropTraining Approach=Training-free, VLM=LLaVA 1.62026.04 | 68.65 | |
| LA+OCR UBVocab=LA2019.04 | 68.24 | |
| Entropy-Gradient GroundingTraining Approach=Training-free, VLM=LLaVA 1.62026.04 | 67.96 | |
| TEVA 3BTraining Approach=Training-based, VLM=TEVA2026.04 | 66.8 | |
| Base modelTraining Approach=Training-free, VLM=LLaVA 1.62026.04 | 65.8 | |
| LaTr+-LargeOCR System=Amazon-OCR, Pre-Training Data=IDL, Extra Finetune=ST-VQA2021.12 | 61.6 | |
| LaTr+-BaseOCR System=Amazon-OCR, Pre-Training Data=IDL, Extra Finetune=ST-VQA2021.12 | 59.55 | |
| Base modelTraining Approach=Training-free, VLM=InternVL 3.52026.04 | 59.47 | |
| LaTr-LargeOCR System=Amazon-OCR, Pre-Training Data=IDL, Extra Finetune=None2021.12 | 59.24 | |
| LaTr-BaseOCR System=Amazon-OCR, Pre-Training Data=IDL, Extra Finetune=None2021.12 | 58.86 | |
| ViCropTraining Approach=Training-free, VLM=LLaVA 1.52026.04 | 55.17 | |
| TAPOCR System=Microsoft-OCR, Pre-Training Data=TextVQA, ST-VQA, TextCaps, OCR-CC, Extra Finetune=ST-VQA2021.12 | 53.97 | |
| Entropy-Gradient GroundingTraining Approach=Training-free, VLM=LLaVA 1.52026.04 | 52.78 | |
| LOGOSOCR System=Microsoft-OCR, Pre-Training Data=None, Extra Finetune=ST-VQA2021.12 | 51.08 | |
| TAPOCR System=Microsoft-OCR, Pre-Training Data=TextVQA, ST-VQA, Extra Finetune=ST-VQA2021.12 | 50.71 | |
| TAPOCR System=Microsoft-OCR, Pre-Training Data=TextVQA, Extra Finetune=None2021.12 | 49.71 | |
| LA UBVocab=LA2019.04 | 48.16 | |
| Base modelTraining Approach=Training-free, VLM=LLaVA 1.52026.04 | 46.22 | |
| SMAOCR System=SBD-Trans OCR, Pre-Training Data=None, Extra Finetune=ST-VQA2021.12 | 45.51 | |
| SA-M4COCR System=Google-OCR, Pre-Training Data=None, Extra Finetune=ST-VQA2021.12 | 44.6 | |
| CRNOCR System=Rosetta-en, Pre-Training Data=None, Extra Finetune=None2021.12 | 40.96 | |
| SMAOCR System=Rosetta-en, Pre-Training Data=None, Extra Finetune=None2021.12 | 40.66 | |
| LaAP-NetOCR System=Rosetta-en, Pre-Training Data=None, Extra Finetune=None2021.12 | 40.54 | |
| M4COCR System=Rosetta-en, Pre-Training Data=None, Extra Finetune=None2021.12 | 39.01 | |
| OCR UB2019.04 | 36.52 | |
| SEALTraining Approach=Training-based, VLM=Llava 1.52026.04 | 36.3 | |
| LoRRA (Pythia backbone)Vocab=SA2019.04 | 27.63 | |
| Pythia (I+Q)Vocab=LA2019.04 | 14 | |
| OCR Max2019.04 | 11.6 | |
| Random OCR2019.04 | 9.12 | |
| QVocab=LA2019.04 | 8.7 | |
| IVocab=LA2019.04 | 5.58 | |
| Majority Ans2019.04 | 2.63 | |
| Wt. Rand 1002019.04 | 0.26 | |
| Rand 1002019.04 | 0.2 |