Visual Question Answering on TextVQA (Accuracy, Cost)
97.15AccuracyOriginal
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OriginalModel=Qwen3-VL-235B-A22B-Instruct2026.02 | 97.15 | 120 | |
| VOIModel=Qwen3-VL-235B-A22B-Instruct2026.02 | 94.1 | 51.75 | |
| JPEG Q10Model=Qwen3-VL-235B-A22B-Instruct2026.02 | 93.65 | 63.9 | |
| OriginalModel=Qwen2-VL-72B-Instruct2026.02 | 93.11 | 120 | |
| VOIModel=Qwen2-VL-72B-Instruct2026.02 | 88.65 | 51.64 | |
| JPEG Q10Model=Qwen2-VL-72B-Instruct2026.02 | 86.84 | 63.9 | |
| Qwen3-VL-8B-InstructStrategy=Instruct2026.02 | 82.3 | — | |
| SAPStrategy=SAP2026.02 | 81.3 | — | |
| VideoLLaMA3Architecture Category=Token Insertion – Proprietary2025.12 | 80.1 | — | |
| Visual FunnelModel=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 79.8 | — | |
| Qwen2-VL# train tokens=1.4T, Architecture Category=Token Insertion – Proprietary2025.12 | 79.7 | — | |
| OriginalModel=Pixtral-12B-24092026.02 | 79.29 | 120 | |
| Grok-1.5V2026.02 | 78.1 | — | |
| GPT-4V2026.02 | 78 | — | |
| Qwen3-VL-8B-ThinkingStrategy=LongCoT2026.02 | 77.2 | — | |
| ViCrop (Top-3)Model=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 76.7 | — | |
| ViCropModel=Qwen2.5-VL-3B-Instruct, Evaluation protocol=zero-shot2025.12 | 76 | — | |
| VOIModel=Pixtral-12B-24092026.02 | 75.92 | 43.09 | |
| InsertionHe-2B# train tokens=0.1T, Architecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 75.5 | — | |
| JPEG Q10Model=Pixtral-12B-24092026.02 | 74.82 | 63.9 | |
| InternVL2.5# train tokens=0.5T, Architecture Category=Token Insertion – Proprietary2025.12 | 74.3 | — | |
| OriginalModel=Qwen2.5-VL-7B-Instruct2026.02 | 73.87 | 120 | |
| Gemini-1.52026.02 | 73.5 | — | |
| SmolVLMArchitecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 73 | — | |
| VOIModel=Qwen2.5-VL-7B-Instruct2026.02 | 72.9 | 50.72 | |
| StreamChat 7BArchitecture Category=Cross-attention-based – Public data, LLM Size=7B2025.12 | 72.4 | — | |
| OriginalModel=Llama-4-Maverick (17Bx12E)2026.02 | 71.56 | 120 | |
| CASA→# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=→, LLM Size=2B2025.12 | 71 | — | |
| CASA∨# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=∨, LLM Size=2B2025.12 | 70.5 | — | |
| CASA⊕# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=⊕, LLM Size=2B2025.12 | 70.3 | — | |
| JPEG Q10Model=Qwen2.5-VL-7B-Instruct2026.02 | 70.26 | 63.9 | |
| Qwen2.5-VL-3B-InstructVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 70.1 | — | |
| JPEG Q1Model=Qwen3-VL-235B-A22B-Instruct2026.02 | 69.85 | 45.4 | |
| mPLUG-Owl3 8B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=8B2025.12 | 69 | — | |
| OriginalModel=LLaVA-1.5-7B-hf2026.02 | 66.45 | 120 | |
| JPEG Q10Model=Llama-4-Maverick (17Bx12E)2026.02 | 65.48 | 63.9 | |
| VOIModel=LLaVA-1.5-7B-hf2026.02 | 64.85 | 47.62 | |
| VOIModel=Llama-4-Maverick (17Bx12E)2026.02 | 64.52 | 44.98 | |
| JPEG Q10Model=LLaVA-1.5-7B-hf2026.02 | 63.25 | 63.9 | |
| mPLUG-Owl3 2B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=2B2025.12 | 62.6 | — | |
| LLaVA 1.5#Training Data=0.7M, Model Size=13B2026.01 | 61.3 | — | |
| Visual FunnelModel=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 59.1 | — | |
| CaptionModel=Qwen3-VL-235B-A22B-Instruct2026.02 | 59.05 | 9.1 | |
| JPEG Q1Model=Qwen2-VL-72B-Instruct2026.02 | 58.96 | 45.4 | |
| NextFlow#Training Data=40M, Model Size=7B2026.01 | 58.9 | — | |
| CaptionModel=Qwen2-VL-72B-Instruct2026.02 | 58.19 | 9.1 | |
| HAVCBackbone=LLaVA-1.5, Signal Type=grad+entropy2026.01 | 57.6 | — | |
| ViCropBackbone=LLaVA-1.5, Signal Type=grad-att2026.01 | 56.15 | — | |
| ViCropBackbone=LLaVA-1.5, Signal Type=rel-att2026.01 | 54.84 | — | |
| ViCropModel=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 54.1 | — | |
| ViCrop (Top-3)Model=LLaVA-1.5-7B, Evaluation protocol=zero-shot2025.12 | 53.5 | — | |
| NextFlow#Training Data=21M, Model Size=7B2026.01 | 52.7 | — | |
| JPEG Q1Model=Pixtral-12B-24092026.02 | 52.28 | 45.4 | |
| CaptionModel=Llama-4-Maverick (17Bx12E)2026.02 | 51.7 | 9.1 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=pure-att2026.01 | 51.42 | — | |
| CaptionModel=Pixtral-12B-24092026.02 | 51.31 | 9.1 | |
| Visual FunnelModel=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 49.8 | — | |
| JPEG Q1Model=LLaVA-1.5-7B-hf2026.02 | 49.5 | 45.4 | |
| NextFlow#Training Data=0.7M, Model Size=7B2026.01 | 49.5 | — | |
| LLaVA-1.5-7BVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 47.9 | — | |
| CaptionModel=LLaVA-1.5-7B-hf2026.02 | 47.8 | 9.1 | |
| VanillaBackbone=LLaVA-1.52026.01 | 46.88 | — | |
| ViCrop (Top-3)Model=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 45.8 | — | |
| ViCropModel=InstructBLIP-7B, Evaluation protocol=zero-shot2025.12 | 45.3 | — | |
| JPEG Q1Model=Llama-4-Maverick (17Bx12E)2026.02 | 45.11 | 45.4 | |
| CaptionModel=Qwen2.5-VL-7B-Instruct2026.02 | 43.48 | 9.1 | |
| HAVCBackbone=InstructBLIP, Signal Type=grad+entropy2026.01 | 41.82 | — | |
| JPEG Q1Model=Qwen2.5-VL-7B-Instruct2026.02 | 41.74 | 45.4 | |
| ViCropBackbone=InstructBLIP, Signal Type=rel-att2026.01 | 41.1 | — | |
| ViCropBackbone=InstructBLIP, Signal Type=grad-att2026.01 | 38.19 | — | |
| ViCropBackbone=InstructBLIP, Signal Type=pure-grad2026.01 | 36.37 | — | |
| VanillaBackbone=InstructBLIP2026.01 | 35.69 | — | |
| InstructBLIP-7BVisual input strategy=No Cropping, Evaluation protocol=zero-shot2025.12 | 33.4 | — | |
| Resize 32x32Model=Llama-4-Maverick (17Bx12E)2026.02 | 25.11 | 18.1 | |
| Resize 32x32Model=Qwen3-VL-235B-A22B-Instruct2026.02 | 22 | 18.1 | |
| Resize 32x32Model=LLaVA-1.5-7B-hf2026.02 | 21.5 | 18.1 | |
| Resize 32x32Model=Pixtral-12B-24092026.02 | 19.57 | 18.1 | |
| Resize 32x32Model=Qwen2-VL-72B-Instruct2026.02 | 19.27 | 18.1 | |
| Resize 32x32Model=Qwen2.5-VL-7B-Instruct2026.02 | 11.35 | 18.1 |