Multimodal Understanding on MME
2,322MME ScoreQwen2-VL-7B
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2-VL-7BToken Budget=Full2026.01 | 2,322 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VisionTrimToken Budget=~1/32026.01 | 2,310 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-26Btoken ratio=100%2024.12 | 2,270 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | |
| FastVtoken ratio=64%2024.12 | 2,270 | — | — | — | — | — | 99.84 | — | — | — | — | — | — | — | |
| SGPtoken ratio=64%2024.12 | 2,259 | — | — | — | — | — | 100.14 | — | — | — | — | — | — | — | |
| SGPtoken ratio=35%2024.12 | 2,258 | — | — | — | — | — | 98.36 | — | — | — | — | — | — | — | |
| ToMetoken ratio=64%2024.12 | 2,235 | — | — | — | — | — | 94.24 | — | — | — | — | — | — | — | |
| JigsawPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 2,222.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLM-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 2,207.17 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jigsaw-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 2,184.29 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen 2.5 VLPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 2,179.83 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ToMetoken ratio=35%2024.12 | 2,178 | — | — | — | — | — | 85.2 | — | — | — | — | — | — | — | |
| FastVtoken ratio=35%2024.12 | 2,140 | — | — | — | — | — | 88.28 | — | — | — | — | — | — | — | |
| MixPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 2,127.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-XLVision Encoder=InternViT-300M, LLM Backbone=Qwen2.5-7B, Resolution=4482025.10 | 2,063 | — | 1,513.7 | — | — | — | — | — | — | — | — | — | — | — | |
| PDropToken Budget=~1/32026.01 | 2,053 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMToken Budget=~1/32026.01 | 2,019 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SGPtoken ratio=9%2024.12 | 2,004 | — | — | — | — | — | 89.58 | — | — | — | — | — | — | — | |
| LLaVA-OneVisionVision Encoder=SigLiP-SO400M, LLM Backbone=Qwen-2-7B, Resolution=3842025.10 | 1,998 | — | 1,580 | — | — | — | — | — | — | — | — | — | — | — | |
| SemHiTok# Params=7B, Resolution=3842025.03 | 1,993.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoneybeeLLM=Vicuna-13B, Projector=D-Abstractor, Vision Encoder=CLIP ViT-L/14, Res.=336, Visual tokens (M)=2562023.12 | 1,950 | — | 1,632 | — | — | — | — | — | — | — | — | — | — | — | |
| HoneybeeLLM=Vicuna-13B, Projector=C-Abstractor, Vision Encoder=CLIP ViT-L/14, Res.=336, Visual tokens (M)=2562023.12 | 1,944 | — | 1,629.3 | — | — | — | — | — | — | — | — | — | — | — | |
| ShareGPT4V# Params=7B, Resolution=3362025.03 | 1,943.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ToMetoken ratio=9%2024.12 | 1,933 | — | — | — | — | — | 54.28 | — | — | — | — | — | — | — | |
| TokenFlow-XLVision Encoder=SigLIP-SO400M, LLM Backbone=Qwen2.5-14B, Resolution=3842025.10 | 1,922.2 | — | 1,551.1 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL1.5architecture=Compositional, params=2.2B2024.12 | 1,902 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoneybeeLLM=Vicuna-7B, Projector=C-Abstractor, Vision Encoder=CLIP ViT-L/14, Res.=224, Visual tokens (M)=1442023.12 | 1,891.3 | — | 1,584.2 | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-2Btoken ratio=100%2024.12 | 1,878 | — | — | — | — | — | 87.25 | — | — | — | — | — | — | — | |
| InternVL2architecture=Compositional, params=2.2B2024.12 | 1,877 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-2Barchitecture=Compositional, params=2.2B2024.12 | 1,872 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoVLEarchitecture=Monolithic, params=2.6B2024.12 | 1,864 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoVLEarchitecture=Monolithic, params=2.6B, resolution=HD2024.12 | 1,862 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA 1.5 7B, Number of Visual Tokens=5762024.12 | 1,862 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | |
| FastVToken Budget=~1/32026.01 | 1,859 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Projector=Resampler, Vision Encoder=OpenCLIP ViT-bigG, Res.=4482023.12 | 1,848.3 | — | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-Vl-Chat# Params=7B, Resolution=4482025.03 | 1,848.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatVision Encoder=CLIP-G, LLM Backbone=Qwen-7B, Resolution=4482025.10 | 1,848.3 | — | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | |
| SynerGen-VL# Params=2.4B, Resolution=5122025.03 | 1,837 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HoneybeeLLM=Vicuna-7B, Projector=D-Abstractor, Vision Encoder=CLIP ViT-L/14, Res.=224, Visual tokens (M)=1442023.12 | 1,835.5 | — | 1,544.1 | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Projector=Linear, Vision Encoder=CLIP ViT-L/14, Res.=3362023.12 | 1,826.7 | — | 1,531.3 | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-LVVision Encoder=SigLIP2-SO400M, LLM Backbone=Vicuna-7B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 1,823 | — | 1,477.9 | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=1922024.12 | 1,820 | — | — | — | — | — | 97.7 | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=1282024.12 | 1,814 | — | — | — | — | — | 97.4 | — | — | — | — | — | — | — | |
| MiniCPM-V-2architecture=Compositional, params=2.8B2024.12 | 1,809 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-LVVision Encoder=InternViT-300M, LLM Backbone=Vicuna-7B, Resolution=448, Training Setting=LLaVA-v1.5 setting2025.10 | 1,803 | — | 1,505.1 | — | — | — | — | — | — | — | — | — | — | — | |
| FastVtoken ratio=9%2024.12 | 1,799 | — | — | — | — | — | 46.99 | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=642024.12 | 1,785 | — | — | — | — | — | 95.9 | — | — | — | — | — | — | — | |
| SemHiTok# Params=7B, Resolution=2562025.03 | 1,775.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1-3B-Chatarchitecture=Compositional, params=3B2024.12 | 1,762 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-LVVision Encoder=DFN-CLIP-L, LLM Backbone=Vicuna-7B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 1,748 | — | 1,446.9 | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMTraining-Free=true, Image Token=449 (-22%)2024.12 | 1,696 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PaliGemma-3Barchitecture=Compositional, params=2.9B2024.12 | 1,686 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TokenFlow-B# Params=13B, Resolution=2242025.03 | 1,660.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TokenFlow-BVision Encoder=CLIP-B, LLM Backbone=Vicuna-13B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 1,660.4 | — | 1,353.6 | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-Varchitecture=Compositional, params=2.8B2024.12 | 1,650 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVE-7Barchitecture=Monolithic, params=7B, resolution=HD2024.12 | 1,628 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TokenFlow-L# Params=13B, Resolution=2562025.03 | 1,622.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TokenFlow-LVision Encoder=ViTamin-XL, LLM Backbone=Vicuna-13B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 1,622.9 | — | 1,365.4 | — | — | — | — | — | — | — | — | — | — | — | |
| VILA1.5-3Barchitecture=Compositional, params=3.1B2024.12 | 1,618 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BModel Size=3B2026.02 | 1,591 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniFlow-LVVision Encoder=DINOv2-L, LLM Backbone=Vicuna-7B, Resolution=378, Training Setting=LLaVA-v1.5 setting2025.10 | 1,590.5 | — | 1,257.7 | — | — | — | — | — | — | — | — | — | — | — | |
| Fine-R1-3BModel Size=3B2026.02 | 1,587 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Instruct-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 1,569.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOVA3-7BTrain Paradigm=VQA, GenQA, EvalQA, LLM=Vicuna-7B2024.05 | 1,552.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-VIDLLM=Vicuna-13B, Resolution=3362023.11 | 1,542.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StableLLaVAnumber of parameters=13B2023.08 | 1,532.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-VL-1.3Barchitecture=Compositional, params=2.0B2024.12 | 1,532 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=3362023.11 | 1,531.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5number of parameters=13B2023.08 | 1,531.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Resolution=3362024.06 | 1,531.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Bilp3o# Tokens=-, # Params.=4B / 9B, Architecture Category=Autoregressive meets Diffusion2025.09 | 1,527.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-Instruct-7BLLM=Vicuna-1.5-7B, Resolution=3362024.06 | 1,523.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaMA-VIDLLM=Vicuna-7B, Resolution=3362023.11 | 1,521.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ArcanaVision Encoder=VIT-L (0.3B), Language Model=Vicuna (7B), MM LoRA=trained during pretrain stage2024.10 | 1,520.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5Type=Und. Only, #Params=7B2024.08 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362023.11 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Vision Encoder=ViT-L (0.3B), Language Model=Vicuna (7B), Zero-shot=true2023.11 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5Backbone LLM=Vicuna-7B2024.06 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BLLM=Vicuna-1.5-7B, Resolution=3362024.06 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5Vision Encoder=VIT-L (0.3B), Language Model=Vicuna (7B)2024.10 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Train Paradigm=VQA, LLM=Vicuna-7B2024.05 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BImage Token=576, TFLOPS=10.12024.12 | 1,510.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EMU3# Params=8B, Resolution=5122025.03 | 1,509.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5 7BRetain Tokens=All 576 Tokens2026.03 | 1,507 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | |
| InstructBLIPLLM=Vicuna-13B, Projector=Q-former, Vision Encoder=EVA-CLIP ViT-G, Res.=2242023.12 | 1,504.6 | — | 1,212.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Dynamic-LLaVA-7B†Training-Free=false, Image Token=115 (-80%)2024.12 | 1,501 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatVision Encoder=ViT-G (1.9B), Language Model=Qwen (7B), Zero-shot=true2023.11 | 1,487.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatVision Encoder=ViT-G (1.9B), Language Model=Qwen (7B)2024.10 | 1,487.58 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatType=Und. Only, #Params=7B2024.08 | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482023.11 | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-Chat2023.08 | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VLBackbone LLM=Qwen-7B2024.06 | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482024.06 | 1,487.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Upper BoundTokens=5762025.12 | 1,487.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiCo-Chat-7BBackbone LLM=Vicuna-7B2024.06 | 1,485.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EVE-7Barchitecture=Monolithic, params=7B2024.12 | 1,483 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Dynamic-LLaVA-7B/Training-Free=false, Image Token=115 (-80%)2024.12 | 1,479.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ArcanaVision Encoder=VIT-L (0.3B), Language Model=Vicuna (7B)2024.10 | 1,476.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-PruMerge+Training-Free=false, Image Token=146 (-75%)2024.12 | 1,462.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TRIMTraining-Free=false, Image Token=455 (-21%)2024.12 | 1,461.3 | — | — | — | — | — | — | — | — | — | — | — | — | — |