Image Understanding on TextVQA
725AccuracyMiniCPM-LLaMA3-V 2.5
Evaluation Results
| Method | Links | |
|---|---|---|
| MiniCPM-LLaMA3-V 2.5Size=8B2026.03 | 725 | |
| Top-k RoutingExpert skipping ratio (ρ)=0, Number of experts (k)=8, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 85.76 | |
| MC-MoEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 84.36 | |
| MoDESExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 84.27 | |
| DiEPExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 83.68 | |
| NAEEExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82.98 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.6, Number of experts (k)=3, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82.16 | |
| MoDESExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 82.13 | |
| Qwen2.5-VLSize=7B2026.03 | 81.2 | |
| Insight-V++Size=7B, Base Model=Qwen2.5-VL, Self-Evolving=true2026.03 | 80.6 | |
| MoDESExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 80.58 | |
| Qwen2.5-VL + Multi-Agent (RL)Size=7B, Multi-Agent (RL)=true2026.03 | 80.4 | |
| MiniCPM-V-2.6Size=7B2026.03 | 78.3 | |
| MC-MoEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 77.41 | |
| Our Base Model + Multi-AgentSize=7B, Multi-Agent=true2026.03 | 77 | |
| DiEPExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 76.84 | |
| Insight-VSize=7B, Base Model=Our Base Model, Iterative DPO=true2026.03 | 76.8 | |
| Our Base ModelSize=7B2026.03 | 75.4 | |
| NAEEExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 75.37 | |
| Ovis1.5-LLaMA3Size=8B2026.03 | 74 | |
| Idefics3-LLaMA3Size=8B2026.03 | 73.2 | |
| Cambrian-1Size=8B2026.03 | 72.6 | |
| Insight-V-LLaVASize=8B, Base Model=LLaVA-NeXT-LLaMA3, Iterative DPO=true2026.03 | 70.5 | |
| MC-MoEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 70.41 | |
| InternLM-XComposer2Size=7B2026.03 | 69.7 | |
| DiEPExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 69.37 | |
| LLaVA-NeXT-LLaMA3 + Multi-AgentSize=8B, Multi-Agent=true2026.03 | 68.9 | |
| NAEEExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 66.24 | |
| LLaVA-NeXT-LLaMA3Size=8B2026.03 | 65.3 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.73, Number of experts (k)=2, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 64.51 | |
| Bunny-LLaMA3Size=8B2026.03 | 62.1 | |
| POINTSSize=7B2026.03 | 60 | |
| Top-k RoutingExpert skipping ratio (ρ)=0.85, Number of experts (k)=1, Backbone=InternVL-3.5-30B-A3B-HF2025.11 | 58.49 | |
| Full-FinetuneDataset=Vision-Flan-186K, #Data=186k2026.05 | 50.4 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 48.6 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 48.27 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 48.25 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 47.27 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 47.16 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 47.1 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 46.65 | |
| MAGICDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 45.7 | |
| RandomDataset=Vision-Flan-186K, #Data=∼37k2026.05 | 45.3 |