Multimodal Understanding on MMStar
82AccuracyInternVL3-8B-Masters
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| InternVL3-8B-MastersSize=8B2025.12 | 82 | — | — | — | |
| L2-VMASBackbone=Qwen3-VL-8B-Thinking2026.01 | 81.4 | — | 3,677 | — | |
| InternVL3.5-8B-MastersSize=8B2025.12 | 80.8 | — | — | — | |
| Keye-VL-1.5-8BSize=8B2025.12 | 80.5 | — | — | — | |
| Insight-VModel Category=MLLM-based Chain-of-Thought Methods2026.06 | 79.8 | — | — | — | |
| Qwen3-VL-8B-MastersSize=8B2025.12 | 79.7 | — | — | — | |
| Qwen3-VL-30B-A3B-InstructInference scheme=no-thinking2026.04 | 78.4 | — | — | — | |
| VMASBackbone=Qwen3-VL-8B-Thinking2026.01 | 78.1 | — | 6,670 | — | |
| RLVRTraining Source=OpenMMR2026.05 | 77.8 | — | — | — | |
| L2-VMASBackbone=Qwen3-VL-8B-Instruct2026.01 | 77.5 | — | 1,907 | — | |
| Gemini-2.5-ProModel Category=Proprietary Models2026.06 | 77.5 | — | — | — | |
| RLVRTraining Source=DeepVision2026.05 | 77.1 | — | — | — | |
| RLR³Training Source=ViRL2026.05 | 76.9 | — | — | — | |
| RLR³Training Source=OpenMMR2026.05 | 76.9 | — | — | — | |
| VLSI-2BSize=2B2024.12 | 76.6 | — | — | — | |
| RLR³Training Source=DeepVision2026.05 | 76.6 | — | — | — | |
| GPT-5-highModel Category=Proprietary Models2026.06 | 76.4 | — | — | — | |
| GPT-52026.02 | 75.7 | — | — | — | |
| Qwen2-VL-72B-ThinkingMax Output Tokens=40K2026.03 | 75.7 | — | — | — | |
| RLVRTraining Source=ViRL2026.05 | 75.7 | — | — | — | |
| SingleBackbone=Qwen3-VL-8B-Thinking2026.01 | 75.5 | — | 687 | — | |
| Keye-VL-8BSize=8B2025.12 | 75.5 | — | — | — | |
| Qwen3-VL-30B-CoTModel Size=30B, Thinking Mode=CoT2026.02 | 75.5 | — | — | — | |
| Qwen2-VL-72B-ThinkingMax Output Tokens=4K2026.03 | 75.5 | — | — | — | |
| Official thinkingSource=Qwen3-VL2026.05 | 75.5 | — | — | — | |
| Qwen3-VL-4B-MastersSize=4B2025.12 | 75.3 | — | — | — | |
| L2-VMASBackbone=LLaVA-OV-1.5-8B2026.01 | 75.1 | — | 2,067 | — | |
| Qwen2.5-VL-7B-MastersSize=7B2025.12 | 74.9 | — | — | — | |
| VMASBackbone=Qwen3-VL-8B-Instruct2026.01 | 74.8 | — | 2,467 | — | |
| L2-VMASBackbone=InternVL-3.5-8B2026.01 | 74.7 | — | 2,189 | — | |
| L2-VMASBackbone=GLM-4.1V-9B-Thinking2026.01 | 74.1 | — | 3,451 | — | |
| Base instruct2026.05 | 74.1 | — | — | — | |
| GPT-5 miniVersion=high2026.05 | 74.1 | — | — | — | |
| VLSI-7BSize=7B2024.12 | 73.6 | — | — | — | |
| Gemini-2.5-Pro2026.02 | 73.6 | — | — | — | |
| EVE-iter3Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=32026.04 | 73.47 | — | — | — | |
| EVE-iter2Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=22026.04 | 73.4 | — | — | — | |
| MIRROR (ours)Param Size=7B2026.02 | 73.33 | — | — | — | |
| VMASBackbone=LLaVA-OV-1.5-8B2026.01 | 73.1 | — | 2,552 | — | |
| EVE-iter1Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=12026.04 | 73.07 | — | — | — | |
| Qwen3-VL-8BTraining Strategy=Staged2026.05 | 73.07 | — | — | — | |
| GLM-4.1V-9BSize=9B2025.12 | 72.9 | — | — | — | |
| MiMo-VL-7B-SFT-2508Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=02026.04 | 72.87 | — | — | — | |
| VMASBackbone=InternVL-3.5-8B2026.01 | 72.5 | — | 2,958 | — | |
| Qwen2-VL-7B-ThinkingMax Output Tokens=40K2026.03 | 72.3 | — | — | — | |
| Official instructSource=Qwen3-VL2026.05 | 72.1 | — | — | — | |
| InternVL3.5-30B-A3BInference scheme=no-thinking2026.04 | 72 | — | — | — | |
| VMASBackbone=GLM-4.1V-9B-Thinking2026.01 | 71.8 | — | 6,744 | — | |
| SingleBackbone=GLM-4.1V-9B-Thinking2026.01 | 71.5 | — | 649 | — | |
| Claude-Opus-4.1Model Category=Proprietary Models2026.06 | 71 | — | — | — | |
| Qwen3-VL-8BSize=8B2025.12 | 70.9 | — | — | — | |
| MiMo-VL-8BSize=8B2025.12 | 70.8 | — | — | — | |
| InternVL3.5-2B-MastersSize=2B2025.12 | 70.7 | — | — | — | |
| Qwen3-VL-8BTraining Strategy=Merged2026.05 | 70.6 | — | — | — | |
| InternVL3.5-4B-MastersSize=4B2025.12 | 70.5 | — | — | — | |
| SingleBackbone=Qwen3-VL-8B-Instruct2026.01 | 70.4 | — | 363 | — | |
| ReMoT-4b-CoTModel Size=4b, Thinking Mode=CoT2026.02 | 70.4 | — | — | — | |
| GPT-4o2026.02 | 70.2 | — | — | — | |
| Qwen3-VL-8BTraining Strategy=Base2026.05 | 70 | — | — | — | |
| Qwen3-VL-4BSize=4B2025.12 | 69.8 | — | — | — | |
| TVI-CoTModel Category=MLLM-based Chain-of-Thought Methods, Model Scale=8B2026.06 | 69.8 | — | — | — | |
| Kimi-VL-A3B-Thinking2026.03 | 69.6 | — | — | — | |
| Ours:base Qwen2.5Params (B)=14+72, Time (s)=3.22025.08 | 69.37 | — | — | — | |
| InternVL3.5-8BSize=8B2025.12 | 69.3 | — | — | — | |
| Qwen2-VL-7B-ThinkingMax Output Tokens=4K2026.03 | 69.3 | — | — | — | |
| SingleBackbone=InternVL-3.5-8B2026.01 | 69 | — | 454 | — | |
| Qwen2.5-VL-3B-MastersSize=3B2025.12 | 68.9 | — | — | — | |
| Qwen2-VL-72BSize=72B2024.12 | 68.6 | — | — | — | |
| Qwen3-VL-8BModel Category=Open-source General Models2025.11 | 68.5 | — | — | — | |
| VAPO-Thinker-7BModel Category=MLLM-based Chain-of-Thought Methods, Model Scale=7B2026.06 | 68.5 | — | — | — | |
| Qwen3-VL-4B-CoTModel Size=4B, Thinking Mode=CoT2026.02 | 68.4 | — | — | — | |
| InternVL3.5-8B +FINER-TuningBackbone=InternVL3.5-8B, Training Strategy=FINER-Tuning2026.03 | 68.3 | — | — | — | |
| Qwen2.5-VLParams (B)=722025.08 | 68.22 | — | — | — | |
| InternVL3-8BSize=8B2025.12 | 68.2 | — | — | — | |
| InternVL3-8BModel Category=Open-source General Models2025.11 | 68.2 | — | — | — | |
| InternVL3-8BModel Category=Open-Source MLLMs, Model Scale=8B2026.06 | 68.2 | — | — | — | |
| InternVL3.5-8BBackbone=InternVL3.5-8B2026.03 | 68 | — | — | — | |
| SenseNova-SIBase Architecture=Bagel-7B-MoT, Model Category=Ours2025.11 | 67.8 | — | — | — | |
| LLaVA-OneVision-1.5-8BSize=8B2025.12 | 67.7 | — | — | — | |
| InternVL3.5-14B +FINER-TuningBackbone=InternVL3.5-14B, Training Strategy=FINER-Tuning2026.03 | 67.7 | — | — | — | |
| LLaVA-OneVision-1.5-8BModel Category=Open-Source MLLMs, Model Scale=8B2026.06 | 67.7 | — | — | — | |
| Bagel-7B-MoTModel Category=Open-source General Models2025.11 | 67.3 | — | — | — | |
| InternVL3.5-14BBackbone=InternVL3.5-14B2026.03 | 67.2 | — | — | — | |
| InternVL2-76BSize=76B2024.12 | 67.1 | — | — | — | |
| Qwen3-VL-8B (Baseline)Model Category=Baseline, Model Scale=8B2026.06 | 67.1 | — | — | — | |
| SingleBackbone=LLaVA-OV-1.5-8B2026.01 | 67 | — | 388 | — | |
| InternVL3-2B-MastersSize=2B2025.12 | 66.7 | — | — | — | |
| Qwen2.5-VLParams (B)=322025.08 | 66.43 | — | — | — | |
| LLaVA-OneVision-72BModel Scale=72B2024.08 | 66.1 | — | — | — | |
| Qwen3-VL-2B-MastersSize=2B2025.12 | 66.1 | — | — | — | |
| LLaVA-OVParams (B)=722025.08 | 66.1 | — | — | — | |
| LLaVA-OV-72BSize=72B2024.12 | 65.8 | — | — | — | |
| SenseNova-SIBase Architecture=Qwen3-VL-8B, Model Category=Ours2025.11 | 65.7 | — | — | — | |
| ResDecBase Model=Qwen2.5-VL2026.02 | 65.47 | — | — | — | |
| SenseNova-SIBase Architecture=InternVL3-8B, Model Category=Ours2025.11 | 65.4 | — | — | — | |
| DLRModel Type=Open-Source, Backbone=Qwen3-VL-8B-Thinking2026.04 | 65.2 | — | — | — | |
| InternVL3.5-4BSize=4B2025.12 | 65 | — | — | — | |
| LLaVA-OneVision-1.5-4BSize=4B2025.12 | 64.9 | — | — | — | |
| Qwen2.5-VL-7BTraining Strategy=Staged2026.05 | 64.79 | — | — | — | |
| GPT-4o (0806)Model Version=08062024.12 | 64.7 | — | — | — |