Multimodal Image Understanding on OCRBench
89.6ScoreQwen3-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VLCategory=Und. Only Models2026.06 | 89.6 | |
| UniARCategory=Unified Models2026.06 | 83.3 | |
| X-OmniCategory=Unified Models2026.06 | 70.4 | |
| Emu3Category=Unified Models2026.06 | 68.7 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 38.6 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 38.3 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 37.3 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 37.1 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 35.2 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 32.1 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 28.7 |