Infographic Question Answering on InfoVQA
89.2ANLSQwen3-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VLSize=235B(A22B)2026.03 | 89.2 | |
| Qwen2.5-VLSize=72B2026.03 | 87.3 | |
| InternVL3.5Size=78B2026.03 | 86.5 | |
| GLM-4.5VSize=106B(A12B)2026.03 | 84.1 | |
| GPT 5.2Size=Closed2026.03 | 84 | |
| InternVL3.5Size=38B2026.03 | 83.8 | |
| Qwen3-VLSize=8B2026.03 | 83.1 | |
| Qwen2.5-VLSize=7B2026.03 | 82.6 | |
| MolmoSize=72B2026.03 | 81.9 | |
| GLM-4.1VSize=9B2026.03 | 80.3 | |
| Qwen3-VLSize=4B2026.03 | 80.3 | |
| Qwen2.5-VL-7BModel Category=Specialist VLMs2026.04 | 80.3 | |
| InternVL3.5Size=8B2026.03 | 79.1 | |
| Q-MaskSize=3B2026.03 | 78.7 | |
| InternVL3.5Size=20B2026.03 | 78.1 | |
| InternVL3.5Size=4B2026.03 | 78 | |
| Qwen2.5-VLSize=3B2026.03 | 77.1 | |
| TokenVL-8BSize=8B2026.03 | 75.3 | |
| MarternSize=8B2026.03 | 75.2 | |
| Q-MaskSize=2B2026.03 | 74.4 | |
| Claude-3.5-SonnetSize=Closed2026.03 | 74.3 | |
| Qwen3-VLSize=2B2026.03 | 72.4 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=37212024.12 | 71.1 | |
| LLaDA2.0-UniModel Category=Unified Models2026.04 | 70.1 | |
| VideoLLaMA3Architecture Category=Token Insertion – Proprietary2025.12 | 69.4 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=37212024.12 | 68.3 | |
| InternVL-UModel Category=Unified Models2026.04 | 68.3 | |
| TextHawk2Size=7B2026.03 | 67.8 | |
| GPT-4oSize=Closed2026.03 | 66.4 | |
| LLaDA-VModel Category=Specialist VLMs2026.04 | 66.3 | |
| Qwen2-VL# train tokens=1.4T, Architecture Category=Token Insertion – Proprietary2025.12 | 65.5 | |
| Gemma3Size=27B2026.03 | 65.1 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=12632024.12 | 62.5 | |
| InsertionHe-2B# train tokens=0.1T, Architecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 61.8 | |
| HunyuanOCRSize=0.9B2026.03 | 61.6 | |
| PDF-WuKong2024.10 | 61.3 | |
| TokenVL-2BSize=2B2026.03 | 61 | |
| InternVL2.5# train tokens=0.5T, Architecture Category=Token Insertion – Proprietary2025.12 | 60.9 | |
| IXC2-4KHD-162024.10 | 60.8 | |
| BAGELModel Category=Unified Models2026.04 | 60.7 | |
| DAVELLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 60.2 | |
| Mini-MonkeySize=2B2026.03 | 60.1 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=12632024.12 | 60 | |
| AIMv2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 57.8 | |
| Gemini 3.0 ProSize=Closed2026.03 | 57.2 | |
| Claude-3-OpusSize=Closed2026.03 | 55.6 | |
| SigLIP 2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 55.2 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=6412024.12 | 55.1 | |
| LLaDA-oModel Category=Unified Models2026.04 | 54.7 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=9182024.12 | 53.9 | |
| CREAM2024.10 | 53.6 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=6412024.12 | 51.2 | |
| DocOwl-1.5-ChatSize=8B2026.03 | 50.7 | |
| TextHawk2024.10 | 50.6 | |
| DAVELLM Backbone=Llama-3.2-3B-Instruct2025.12 | 50.2 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+11.9, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=6412024.12 | 49.7 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=2332024.12 | 49.6 | |
| PixtralSize=12B2026.03 | 49.5 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=9182024.12 | 49.3 | |
| CASA→# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=→, LLM Size=2B2025.12 | 48.6 | |
| CASA⊕# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=⊕, LLM Size=2B2025.12 | 48.2 | |
| DocKylinSize=7B2026.03 | 46.6 | |
| DocOwl 22024.10 | 46.4 | |
| LLAVAOVVision Encoder=ViT-SO400M, LLM=Qwen2, Data (M) (PT+IT)=4.5+3.2, Input Res.=1152, #Visual Tokens=7290, Vis. Enc. Size(M)=430, TTFT (ms)=141242024.12 | 46.3 | |
| ILLUMELLM=Vicuna-7B, Category=Unify Understanding and Generation2024.12 | 45.5 | |
| MM1Vision Encoder=ViT-H, LLM=3000+1.5, Input Res.=1344, #Visual Tokens=720, Vis. Enc. Size(M)=632, TTFT (ms)=-2024.12 | 45.5 | |
| CASA∨# train tokens=0.3T, Architecture=CASAHe-2B, CASA design variant=∨, LLM Size=2B2025.12 | 44.8 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+11.9, Input Res.=768, #Visual Tokens=144, Vis. Enc. Size(M)=125, TTFT (ms)=4462024.12 | 44.3 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+6.5, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=6412024.12 | 44.2 | |
| Emu3-ChatLLM=8B from scratch, Category=Understanding Only2024.12 | 43.8 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=1662024.12 | 43.3 | |
| SmolVLMArchitecture Category=Token Insertion – Public data, LLM Size=2B2025.12 | 42.2 | |
| UReaderSize=7B2026.03 | 42.2 | |
| DophineLLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 42 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=2332024.12 | 41.7 | |
| SigLIP 2LLM Backbone=Llama-3.2-3B-Instruct2025.12 | 40.6 | |
| MM1Vision Encoder=ViT-H, LLM=3000+1.5, Input Res.=1344, #Visual Tokens=720, Vis. Enc. Size(M)=632, TTFT (ms)=-2024.12 | 38.5 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+1.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=6412024.12 | 37.5 | |
| DophineLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 37.4 | |
| LLaVA-NeXTLLM=Vicuna-7B, Category=Understanding Only2024.12 | 37.1 | |
| mPLUG-Owl3 8B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=8B2025.12 | 36.8 | |
| LLaMA3.2Size=11B2026.03 | 36.6 | |
| MonkeySize=10B2026.03 | 36.1 | |
| Monkey2024.10 | 36.1 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=1662024.12 | 35.8 | |
| AIMv2LLM Backbone=Llama-3.2-3B-Instruct2025.12 | 35.6 | |
| Qwen-VL2024.10 | 35.4 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=15+1.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=5772024.12 | 34.7 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+1.1, Input Res.=768, #Visual Tokens=144, Vis. Enc. Size(M)=125, TTFT (ms)=4462024.12 | 34.3 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=15+1.1, Input Res.=768, #Visual Tokens=144, Vis. Enc. Size(M)=125, TTFT (ms)=3872024.12 | 32 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=0.5+1.1, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=5772024.12 | 32 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=0.5+1.1, Input Res.=768, #Visual Tokens=144, Vis. Enc. Size(M)=125, TTFT (ms)=3872024.12 | 29.7 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=0.5+0.6, Input Res.=1024, #Visual Tokens=256, Vis. Enc. Size(M)=125, TTFT (ms)=5772024.12 | 28.9 | |
| FastVLMVision Encoder=FastViTHD, LLM=Vicuna, Data (M) (PT+IT)=0.5+0.6, Input Res.=768, #Visual Tokens=144, Vis. Enc. Size(M)=125, TTFT (ms)=3872024.12 | 28.7 | |
| MAE-WebLLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 28.6 | |
| TextMonkeySize=8B2026.03 | 28.6 | |
| Text-Monkey2024.10 | 28.6 | |
| mPLUG-Owl3 2B# train tokens=0.1T, Architecture Category=Cross-attention-based – Public data, LLM Size=2B2025.12 | 28.1 | |
| MAE-WebLLM Backbone=Llama-3.2-3B-Instruct2025.12 | 26.2 | |
| LLaVA-1.5LLM=Vicuna-7B, Category=Understanding Only2024.12 | 25.8 |