Visual Perception on OCRBench
877ScoreQwen2-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VLSize=7B2026.03 | 877 | |
| MiniCPM-V-2.6Size=7B2026.03 | 852 | |
| Qwen2.5-VLSize=7B2026.03 | 842 | |
| Insight-V++Size=7B, Base Model=Qwen2.5-VL, Self-Evolving=true2026.03 | 830 | |
| Qwen2.5-VL + Multi-Agent (RL)Size=7B, Multi-Agent (RL)=true2026.03 | 822 | |
| Our Base Model + Multi-AgentSize=7B, Multi-Agent=true2026.03 | 738 | |
| Insight-VSize=7B, Base Model=Our Base Model, Iterative DPO=true2026.03 | 735 | |
| Our Base ModelSize=7B2026.03 | 713 | |
| Insight-V-LLaVASize=8B, Base Model=LLaVA-NeXT-LLaMA3, Iterative DPO=true2026.03 | 663 | |
| LLaVA-NeXT-LLaMA3 + Multi-AgentSize=8B, Multi-Agent=true2026.03 | 631 | |
| LLaVA-NeXT-LLaMA3Size=8B2026.03 | 553 | |
| Qwen2.5-VL + LOCUSSize=7B2026.06 | 85.4 | |
| MiMo-VL + LOCUSSize=7B2026.06 | 82.7 | |
| Qwen2.5-VLSize=7B2026.06 | 82 | |
| MiMo-VLSize=7B2026.06 | 81.3 | |
| Qwen2-VL-2BTarget LLM=Public Models2026.05 | 80.9 | |
| Qwen3-VLSize=4B2026.06 | 78.4 | |
| Qwen3-VL + LOCUSSize=4B2026.06 | 77.7 | |
| DPA-Qwen3-32BTarget LLM=Qwen3-32B2026.05 | 76.8 | |
| DPA-Qwen3-4BTarget LLM=Qwen3-4B2026.05 | 74.7 | |
| LLaVA-NeXT-Qwen3-32BTarget LLM=Qwen3-32B2026.05 | 73.8 | |
| DPA-LLaMA-3.2-3BTarget LLM=LLaMA-3.2-3B2026.05 | 69.2 | |
| LLaVA-NeXT-Qwen3-4BTarget LLM=Qwen3-4B2026.05 | 69.1 | |
| Idefics2-8BTarget LLM=Public Models2026.05 | 63 | |
| LLaVA-NeXT-LLaMA-3.2-3BTarget LLM=LLaMA-3.2-3B2026.05 | 62 | |
| Cambrian-1-8BTarget LLM=Public Models2026.05 | 60.2 | |
| LLaVA-NeXT-7BTarget LLM=Public Models2026.05 | 50.2 | |
| LLaVA-1.5-7BTarget LLM=Public Models2026.05 | 20.2 |