Multimodal Understanding on MMBench
90.6AccuracyQwen3-VL-32B
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-32B2025.06 | 90.6 | — | — | — | — | — | — | — | — | 82.5 | — | — | |
| InternVL3.5-38B2025.06 | 90.3 | — | — | — | — | — | — | — | — | 82.8 | — | — | |
| Gemini-2.5-ProModel Category=Proprietary Models2026.06 | 90.1 | — | — | — | — | — | — | — | — | — | — | — | |
| GenRecal (Qwen3-VL-8B)Teacher VLM=Qwen3-VL-32B2025.06 | 89.9 | — | — | — | — | — | — | — | — | 80.1 | — | — | |
| GenRecal (Qwen3-VL-8B)Teacher VLM=InternVL3.5-38B2025.06 | 89.7 | — | — | — | — | — | — | — | — | 80 | — | — | |
| GenRecal (InternVL3.5-8B)Teacher VLM=Qwen3-VL-32B2025.06 | 89.6 | — | — | — | — | — | — | — | — | 83.4 | — | — | |
| GenRecal (InternVL3.5-8B)Teacher VLM=InternVL3.5-38B2025.06 | 89.4 | — | — | — | — | — | — | — | — | 83.4 | — | — | |
| L2-VMASBackbone=Qwen3-VL-8B-Thinking2026.01 | 88.8 | — | — | — | — | — | 2,983 | — | — | — | — | — | |
| Qwen2.5-VL 72BLLM=Qwen2.5-72B2025.12 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | |
| TVI-CoTBackbone=Qwen3-VL-32B2026.06 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-32BBackbone=Qwen3-VL-32B2026.06 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B-Thinking2025.11 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | |
| L2-VMASBackbone=Qwen3-VL-8B-Instruct2026.01 | 87.4 | — | — | — | — | — | 1,682 | — | — | — | — | — | |
| LaReBase VLM=Qwen3-VL-8B-Instruct2025.11 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-38BLLM=Qwen3-32B2025.12 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL + DiGLLM=Qwen3-8B2025.12 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | |
| ThymeBase VLM=Qwen3-VL-8B-Instruct2025.11 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B2025.06 | 86.8 | — | — | — | — | — | — | — | — | 77 | — | — | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Complete2026.04 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | |
| CapImagineBase VLM=Qwen3-VL-8B-Instruct2025.11 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-32BToken Budget=100%, Backbone Model=Qwen2.5-VL-32B2026.04 | 86.6 | — | — | — | — | — | — | — | — | 100 | — | — | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Random2026.04 | 86.6 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-8B2025.06 | 86.5 | — | — | — | — | — | — | — | — | 80.4 | — | — | |
| VanillaBackbone=Qwen3-VL-30B-A3B, Pruning Ratio=100%2026.05 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Layered2026.04 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Centralized2026.04 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 8B-RModel Scale=8B, Strategy=Reasoning2026.04 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen3-VL 8B-Instruct, Baseline=Linear2026.04 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Random2026.04 | 85.8 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Complete2026.04 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | |
| Baichuan-Omni-1.5Model Category=Perception-centric2026.03 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLLLM=Qwen3-8B2025.12 | 85.5 | — | — | — | — | — | — | — | — | — | — | — | |
| SophiaVL-R1-7BParameters=7B2025.05 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Layered2026.04 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | |
| VMASBackbone=Qwen3-VL-8B-Thinking2026.01 | 85.3 | — | — | — | — | — | 5,241 | — | — | — | — | — | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Centralized2026.04 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 8B-SModel Scale=8B, Strategy=Simple2026.04 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | |
| RandomModel=Qwen3-VL 8B-Instruct2026.04 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 85.1 | — | — | — | — | — | — | — | — | 94 | — | — | |
| DivPruneToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 85.1 | — | — | — | — | — | — | — | — | 93.4 | — | — | |
| Qwen3-VL 8B + 2B-RMain Model=8B, Source Model=2B-R, Strategy=Reasoning Transfer2026.04 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 8B + 4B-RMain Model=8B, Source Model=4B-R, Strategy=Reasoning Transfer2026.04 | 85.1 | — | — | — | — | — | — | — | — | — | — | — | |
| BAGELModel Category=Unified2026.03 | 85 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=Qwen2.5-VL 7B-Instruct, Baseline=Linear2026.04 | 85 | — | — | — | — | — | — | — | — | — | — | — | |
| BagelUnified=✓, #Params=7B, Visual Representation Type=Continuous2026.06 | 85 | — | — | — | — | — | — | — | — | — | — | — | |
| VMASBackbone=Qwen3-VL-8B-Instruct2026.01 | 84.9 | — | — | — | — | — | 2,190 | — | — | — | — | — | |
| CompleteModel=Qwen3-VL 8B-Instruct2026.04 | 84.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=InternVL3-8B, Baseline=Complete2026.04 | 84.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SingleBackbone=Qwen3-VL-8B-Thinking2026.01 | 84.8 | — | — | — | — | — | 557 | — | — | — | — | — | |
| Ovis2-8BModel Category=MMU-Experts2026.03 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen3-VL-30B-A3B, Pruning Ratio=70%2026.05 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | |
| 16-bit BaselineBackbone=InternVL2.5, Precision (W/A)=16-bit2026.03 | 84.71 | — | — | — | — | — | — | — | — | — | — | — | |
| VMASBackbone=LLaVA-OV-1.5-8B2026.01 | 84.7 | — | — | — | — | — | 2,278 | — | — | — | — | — | |
| TVI-CoTModel Category=MLLM-based Chain-of-Thought Methods, Model Scale=8B2026.06 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B-InstructParameters=7B, Training Strategy=SFT+GRPO2025.05 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| LayeredModel=Qwen3-VL 8B-Instruct2026.04 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| CompleteModel=Qwen2.5-VL 7B-Instruct2026.04 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=InternVL3-8B, Baseline=Random2026.04 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| VisMMOEBackbone=Qwen3-VL-30B-A3B, Pruning Ratio=70%2026.05 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5Unified=✗, #Params=8B, Visual Representation Type=Continuous2026.06 | 84.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL + DiGLLM=Qwen3-4B2025.12 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 4B-RModel Scale=4B, Strategy=Reasoning2026.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-VL 7B-Instruct2026.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | |
| L2-VMASBackbone=LLaVA-OV-1.5-8B2026.01 | 84.4 | — | — | — | — | — | 1,824 | — | — | — | — | — | |
| SkillGraphModel=InternVL3-8B, Baseline=Centralized2026.04 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | |
| CentralizedModel=Qwen3-VL 8B-Instruct2026.04 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=InternVL3-8B, Baseline=Layered2026.04 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | |
| IWPToken Budget=35.3%, Backbone Model=Qwen2.5-VL-32B2026.04 | 84.2 | — | — | — | — | — | — | — | — | 94.2 | — | — | |
| DirectAnswerModel=Qwen3-VL 8B-Instruct2026.04 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | |
| LayeredModel=Qwen2.5-VL 7B-Instruct2026.04 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini2.5-Pro2025.11 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 4B + 2B-RMain Model=4B, Source Model=2B-R, Strategy=Reasoning Transfer2026.04 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Complete2026.04 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-1.5-8BModel Category=Open-Source MLLMs, Model Scale=8B2026.06 | 84.1 | — | — | — | — | — | — | — | — | — | — | — | |
| SingleBackbone=Qwen3-VL-8B-Instruct2026.01 | 84 | — | — | — | — | — | 318 | — | — | — | — | — | |
| DirectAnswerModel=Qwen2.5-VL 7B-Instruct2026.04 | 83.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Random2026.04 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| CentralizedModel=Qwen2.5-VL 7B-Instruct2026.04 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=InternVL3-8B, Baseline=Linear2026.04 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-5-highModel Category=Proprietary Models2026.06 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLLLM=Qwen3-4B2025.12 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL 4B-SModel Scale=4B, Strategy=Simple2026.04 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | |
| LinearModel=Qwen3-VL 8B-Instruct2026.04 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBackbone=Qwen3-VL-30B-A3B, Pruning Ratio=50%2026.05 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8BModel Category=MMU-Experts2026.03 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Centralized2026.04 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| LinearModel=Qwen2.5-VL 7B-Instruct2026.04 | 83.6 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-2.5-VL-7BResolution Strategy=Fixed, Token Retention Ratio=100%2025.08 | 83.59 | — | — | — | — | — | — | — | — | — | — | — | |
| TroL-7BParameters=7B2024.06 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-8B-VisualPRMParameters=8B2025.05 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| SkillGraphModel=LLaVA-OV Qwen2-7B, Baseline=Layered2026.04 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| VisMMOEBackbone=Qwen3-VL-30B-A3B, Pruning Ratio=50%2026.05 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLUnified=✗, #Params=7B, Visual Representation Type=Continuous2026.06 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| BLIP-3oUnified=✓, #Params=8B, Visual Representation Type=Continuous2026.06 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-26Btoken ratio=100%2024.12 | 83.46 | 100 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLLLM=Qwen2.5-7B, Number of Parameters=~7B2026.02 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B-InstructParameters=7B, Training Strategy=GRPO2025.05 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3-8BModel Category=Open-Source MLLMs, Model Scale=8B2026.06 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8B (Baseline)Model Category=Baseline, Model Scale=8B2026.06 | 83.4 | — | — | — | — | — | — | — | — | — | — | — | |
| SGPtoken ratio=64%2024.12 | 83.3 | 100.14 | — | — | — | — | — | — | — | — | — | — |