Multimodal Image Understanding on InfoVQA
83.1ScoreQwen3-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VLCategory=Und. Only Models2026.06 | 83.1 | |
| UniARCategory=Unified Models2026.06 | 70 | |
| LLaVA-OVCategory=Und. Only Models2026.06 | 68.8 | |
| Emu3Category=Unified Models2026.06 | 43.8 | |
| LLaVA-1.6Category=Und. Only Models2026.06 | 37.1 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 32.46 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 30.93 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 30.55 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 30.02 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 28.14 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 17.32 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 16.22 |