Document Understanding on DocVQA (test)
96.5AccuracyQwen2-VL-72B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VL-72BModel Scale=72B2024.12 | 96.5 | |
| Claude-3.5-Sonnet2024.12 | 95.2 | |
| Qwen2-VL-7B-InsModel Scale=7B2024.12 | 94.5 | |
| InternVL2-76BModel Scale=76B2024.12 | 94.1 | |
| Qwen2.5VL-3BComplexity=O(n)2025.12 | 93.9 | |
| MAmmoTH-VL-8BModel Scale=8B, Single-image variant (SI)=true2024.12 | 93.8 | |
| MAmmoTH-VL-8BModel Scale=8B2024.12 | 93.7 | |
| Gemini-1.5 Pro2024.10 | 93.1 | |
| Gemini-1.5-Pro2024.12 | 93.1 | |
| GPT-4o2024.08 | 92.8 | |
| GPT-4o2024.10 | 92.8 | |
| GPT-4o2024.12 | 92.8 | |
| ARIA2024.10 | 92.6 | |
| Molmo-7B-DModel Scale=7B2024.12 | 92.2 | |
| LLaVA-OV-72BModel Scale=72B, Single-image variant (SI)=true2024.12 | 91.8 | |
| InfiniteVL-4BComplexity=O(1)2025.12 | 91.7 | |
| InternVL-2-8BModel Scale=8B2024.12 | 91.6 | |
| InternVL2.5-4BComplexity=O(n)2025.12 | 91.6 | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 91.3 | |
| LLaVA-OV-72BModel Scale=72B2024.12 | 91.3 | |
| INXComp-2.5-7BModel Scale=2.5B2024.12 | 90.9 | |
| MiniCPM-V-2.6-7BModel Scale=7B2024.12 | 90.8 | |
| Pixtral-12B2024.10 | 90.7 | |
| Gemini-1.5 Flash2024.10 | 89.9 | |
| GPT-4VVersion=V-Preview2024.08 | 88.4 | |
| Llama3.2-11B2024.10 | 88.4 | |
| GPT-4V2024.10 | 88.4 | |
| Llama-3.2-11B-Vision-InsModel Scale=11B2024.12 | 88.4 | |
| LLaVA-OneVision-7BModel Scale=7B2024.08 | 87.5 | |
| LLaVA-OV-7BModel Scale=7B2024.12 | 87.5 | |
| LLaVA-OV-7BModel Scale=7B, Single-image variant (SI)=true2024.12 | 86.9 | |
| SmolVLM2-2BComplexity=O(n)2025.12 | 80 | |
| Cambrian-1-8BModel Scale=8B2024.12 | 77.8 | |
| PaliGemma2-3BComplexity=O(n)2025.12 | 71.6 | |
| LLaVA-OneVision-0.5BModel Scale=0.5B2024.08 | 70 | |
| Phi-3.5-Vision-4BComplexity=O(n)2025.12 | 69.3 | |
| TinyLLaVA-3BComplexity=O(n)2025.12 | 34.7 | |
| MaTVLM-3BComplexity=O(n)2025.12 | 33 | |
| Cobra-3BComplexity=O(1)2025.12 | 24 |