Visual Reasoning on MMMU-Pro avg
45.6AccuracyInsight-V++
Evaluation Results
| Method | Links | |
|---|---|---|
| Insight-V++Size=7B, Base Model=Qwen2.5-VL, Self-Evolving=true2026.03 | 45.6 | |
| Qwen2.5-VL + Multi-Agent (RL)Size=7B, Multi-Agent (RL)=true2026.03 | 42.9 | |
| Qwen2.5-VLSize=7B2026.03 | 38.3 | |
| MiniCPM-V-2.6Size=7B2026.03 | 27.2 | |
| Insight-VSize=7B, Base Model=Our Base Model, Iterative DPO=true2026.03 | 24.9 | |
| Our Base Model + Multi-AgentSize=7B, Multi-Agent=true2026.03 | 23.8 | |
| Ovis1.5-LLaMA3Size=8B2026.03 | 23.6 | |
| Idefics3-LLaMA3Size=8B2026.03 | 22.9 | |
| Our Base ModelSize=7B2026.03 | 22.6 | |
| Insight-V-LLaVASize=8B, Base Model=LLaVA-NeXT-LLaMA3, Iterative DPO=true2026.03 | 21 | |
| MiniCPM-LLaMA3-V 2.5Size=8B2026.03 | 19.6 | |
| LLaVA-NeXT-LLaMA3 + Multi-AgentSize=8B, Multi-Agent=true2026.03 | 17.8 | |
| LLaVA-NeXT-LLaMA3Size=8B2026.03 | 13.2 |