Document Visual Question Answering on DocVQA
97.2ANLSORCA (Qwen3VL-8B)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ORCA (Qwen3VL-8B)Open-source=true, Architectural Paradigm=ORCA (Multi-Agent Framework)2026.03 | 97.2 | — | — | |
| Qwen3-VLSize=235B(A22B)2026.03 | 97.1 | — | — | |
| OURS (KG SELF-PLAY)PARAMS=4B2026.05 | 96.8 | — | — | |
| Qwen2-VLOpen-source=true, Architectural Paradigm=General-Purpose VLMs2026.03 | 96.7 | — | — | |
| ORCA (Qwen2.5-VL-7B)Open-source=true, Architectural Paradigm=ORCA (Multi-Agent Framework)2026.03 | 96.4 | — | — | |
| Qwen2.5-VLSize=72B2026.03 | 96.4 | — | — | |
| Qwen3VL-8B-InstructOpen-source=true, Architectural Paradigm=Baseline VLMs (Single-Model)2026.03 | 96.1 | — | — | |
| Qwen3-VLSize=8B2026.03 | 96.1 | — | — | |
| ORCA (Qwen3VL-4B)Open-source=true, Architectural Paradigm=ORCA (Multi-Agent Framework)2026.03 | 96 | — | — | |
| Qwen2.5-VLLLM Backbone=Qwen2.5-7B, Open Data=false, Super-Image (SI)=false2025.12 | 95.7 | — | — | |
| MiMo-VL-RLLLM Backbone=MiMo-7B, Open Data=false, Super-Image (SI)=false2025.12 | 95.7 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 95.7 | — | — | |
| Qwen2.5-VL-7B-InstructOpen-source=true, Architectural Paradigm=Baseline VLMs (Single-Model)2026.03 | 95.7 | — | — | |
| Qwen2.5-VLSize=7B2026.03 | 95.7 | — | — | |
| Qwen2.5-VLParams=7B, Base model=Qwen-2.5-VL2026.05 | 95.7 | — | — | |
| QWEN3-VL + SFT ONLYPARAMS=4B2026.05 | 95.6 | — | — | |
| QWEN3-VL + SPIN (NO KG)PARAMS=4B2026.05 | 95.57 | — | — | |
| Qwen2.5-VL-VIFParams=7B, Base model=Qwen-2.5-VL2026.05 | 95.5 | — | — | |
| InternVL3.5Size=78B2026.03 | 95.4 | — | — | |
| Qwen3VL-4B-InstructOpen-source=true, Architectural Paradigm=Baseline VLMs (Single-Model)2026.03 | 95.3 | — | — | |
| Qwen3-VLSize=4B2026.03 | 95.3 | — | — | |
| QWEN3-VL (VANILLA)PARAMS=4B2026.05 | 95.3 | — | — | |
| Claude 3.5 SonnetOpen Data=false, Super-Image (SI)=false2025.12 | 95.2 | — | — | |
| Claude-3.5-SonnetSize=Closed2026.03 | 95.2 | — | — | |
| InternVL2-ProOpen-source=true, Architectural Paradigm=General-Purpose VLMs2026.03 | 95.1 | — | — | |
| MiMo-VL-7B-RLOpen-source=true, Architectural Paradigm=Reasoning-Enhanced OS Models2026.03 | 95 | — | — | |
| VideoLLaMA3-7BOpen-source=true, Architectural Paradigm=Reasoning-Enhanced OS Models2026.03 | 95 | — | — | |
| BaselineCompression Ratio=0%, Backbone=Qwen-2.5-7B-Instruct2026.02 | 94.9 | — | — | |
| BaselineBase Model=Qwen-2.5-VL-7B-Instruct2026.02 | 94.9 | — | — | |
| Qwen2.5-VL-7BModel Category=Specialist VLMs2026.04 | 94.9 | — | — | |
| LLaVA-One-Vision-8BOpen-source=true, Architectural Paradigm=General-Purpose VLMs2026.03 | 94.8 | — | — | |
| Qwen2.5-VL-SFTParams=7B, Base model=Qwen-2.5-VL2026.05 | 94.8 | — | — | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+23.1, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=37212024.12 | 94.5 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 94.5 | — | — | |
| GLM-4.5VSize=106B(A12B)2026.03 | 94.5 | — | — | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true, Super-Image (SI)=true2025.12 | 94.4 | — | — | |
| Dream-VLLLM Backbone=Dream 7B, Open Data=true, Super-Image (SI)=false2025.12 | 94.4 | — | — | |
| BAGELModel Category=Unified Models2026.04 | 94.3 | — | — | |
| Claude-3.7 SonnetOpen-source=false, Architectural Paradigm=General-Purpose VLMs2026.03 | 94.1 | — | — | |
| InternVL3.5Size=38B2026.03 | 94 | — | — | |
| Qwen2.5-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 93.9 | — | — | |
| Qwen2.5-VLSize=3B2026.03 | 93.9 | — | — | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true, Super-Image (SI)=true2025.12 | 93.8 | — | — | |
| TokenVL-8BSize=8B2026.03 | 93.8 | — | — | |
| MAmmoTH-VLLLM Backbone=Qwen2.5-7B, Open Data=true, Super-Image (SI)=false2025.12 | 93.7 | — | — | |
| Molmo-72BOpen-source=true, Architectural Paradigm=General-Purpose VLMs2026.03 | 93.5 | — | — | |
| MolmoSize=72B2026.03 | 93.5 | — | — | |
| Q-MaskSize=3B2026.03 | 93.5 | — | — | |
| DeepSeek-VL2Open-source=true, Architectural Paradigm=General-Purpose VLMs2026.03 | 93.3 | — | — | |
| GLM-4.1VSize=9B2026.03 | 93.3 | — | — | |
| Qwen3-VLSize=2B2026.03 | 93.3 | — | — | |
| Q-MaskSize=2B2026.03 | 93.3 | — | — | |
| VisionSelectorCompression Ratio=75%, Backbone=Qwen-2.5-7B-Instruct2026.02 | 93.24 | — | — | |
| VisionSelectorRetained Tokens=25%2026.02 | 93.24 | — | — | |
| IDPrunerCompression Ratio=75%, Backbone=Qwen-2.5-7B-Instruct2026.02 | 93.16 | — | — | |
| IDPrunerRetained Tokens=25%2026.02 | 93.16 | — | — | |
| Gemini-1.5 ProOpen Data=false, Super-Image (SI)=false2025.12 | 93.1 | — | — | |
| Qwen-VL-Max (single)Open-source=false, Architectural Paradigm=General-Purpose VLMs2026.03 | 93.1 | — | — | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 93 | — | — | |
| GPT-4oOpen-source=false, Architectural Paradigm=General-Purpose VLMs2026.03 | 93 | — | — | |
| Qwen2.5-VL-32BToken Budget=100%, Backbone Model=Qwen2.5-VL-32B2026.04 | 93 | — | 100 | |
| InternVL3.5Size=20B2026.03 | 92.9 | — | — | |
| GPT-4oOpen Data=false, Super-Image (SI)=false2025.12 | 92.8 | — | — | |
| GPT-4oSize=Closed2026.03 | 92.8 | — | — | |
| InternVL3LLM Backbone=Qwen2.5-7B, Open Data=false, Super-Image (SI)=false2025.12 | 92.7 | — | — | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 92.7 | — | — | |
| InternVL3.5Size=4B2026.03 | 92.4 | — | — | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=37212024.12 | 92.3 | — | — | |
| InternVL3.5Size=8B2026.03 | 92.3 | — | — | |
| Molmo-8B-DLLM Backbone=Qwen2 7B, Open Data=true, Super-Image (SI)=false2025.12 | 92.2 | — | — | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 92.1 | — | — | |
| MarternSize=8B2026.03 | 92 | — | — | |
| GPT 5.2Size=Closed2026.03 | 91.7 | — | — | |
| InternVL2-8BBackbone=8B2025.03 | 91.66 | — | — | |
| InternVL 2Size=8B, Visual tokens=31332024.09 | 91.6 | — | — | |
| LLaDA-oModel Category=Unified Models2026.04 | 91.5 | — | — | |
| DocVALModel Size=12B, Base Model=Gemma3-12B2025.11 | 91.4 | 0.824 | — | |
| Entropy-Gradient GroundingTraining Approach=Training-free, VLM=Qwen 2.5 VL2026.04 | 91.16 | — | — | |
| IXC 2.5Size=7B, Visual tokens=51182024.09 | 90.9 | — | — | |
| DAVELLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 90.9 | — | — | |
| Base modelTraining Approach=Training-free, VLM=Qwen 2.5 VL2026.04 | 90.81 | — | — | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Data (M) (PT+IT)=15+12.5, Input Res.=2048, #Visual Tokens=1280, Vis. Enc. Size(M)=125, TTFT (ms)=12632024.12 | 90.2 | — | — | |
| SigLIP 2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 90.2 | — | — | |
| Qwen2-VLInput=Any Res., RoPE=M-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 90.1 | — | — | |
| Encoder-BasedInput=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 89.9 | — | — | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 89.9 | — | — | |
| TokenVL-2BSize=2B2026.03 | 89.9 | — | — | |
| TextHawk2Size=7B2026.03 | 89.6 | — | — | |
| LLaDA2.0-UniModel Category=Unified Models2026.04 | 89.5 | — | — | |
| AIMv2LLM Backbone=Qwen-2.5-7B-Instruct2025.12 | 89.3 | — | — | |
| Claude-3-OpusSize=Closed2026.03 | 89.3 | — | — | |
| INTERNVL2PARAMS=4B2026.05 | 89.2 | — | — | |
| X-Omni2026.03 | 89.1 | — | — | |
| DocVALModel Size=4B, Base Model=Gemma3-4B2025.11 | 88.7 | 0.691 | — | |
| InternVL2.5Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 88.7 | — | — | |
| NEOInput=Any Res., RoPE=Native-RoPE, Backbone=Dense, Parameter Scale=8B2025.10 | 88.6 | — | — | |
| GvU2026.03 | 88.4 | — | — | |
| GPT-4V-11062026.05 | 88.4 | — | — | |
| InternVL3Input=Tile-wise, RoPE=1D-RoPE, Backbone=Dense, Parameter Scale=2B2025.10 | 88.3 | — | — | |
| Gemini Pro2026.05 | 88.1 | — | — |