Multimodal Image Understanding on DocVQA
96.1ScoreQwen3-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VLCategory=Und. Only Models2026.06 | 96.1 | |
| UniARCategory=Unified Models2026.06 | 91.4 | |
| X-OmniCategory=Unified Models2026.06 | 88.6 | |
| LLaVA-OVCategory=Und. Only Models2026.06 | 87.5 | |
| Emu3Category=Unified Models2026.06 | 76.3 | |
| LLaVA-1.6Category=Und. Only Models2026.06 | 74.4 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 46.89 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 46.77 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 46.59 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 44.6 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 43.13 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 27.25 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 25.27 |