Multi-modal Perception Evaluation on MME Perception
1,533Perception ScoreVILA
Evaluation Results
| Method | Links | |
|---|---|---|
| VILAPretrained-LLM=LLaMA2-7B, Model Category=Understanding Only Model2026.02 | 1,533 | |
| LLaVA-1.5Pretrained-LLM=Vicuna-7B, Model Category=Understanding Only Model2026.02 | 1,510.7 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 1,510.7 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=4482026.07 | 1,487.5 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=3362026.07 | 1,477.4 | |
| LLaVA-SPLLM=Vicuna-7B, Resolution=3362026.07 | 1,470.7 | |
| UniTokPretrained-LLM=LLaMA-2-7B, Model Category=Unified Model2026.02 | 1,448 | |
| VanillaVision Token=576, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,446 | |
| UniWeTok-ChatPretrained-LLM=Qwen3-8B, Model Category=Unified Model2026.02 | 1,415.7 | |
| MS-ResamplerVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,396 | |
| LDP-v2Vision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,394 | |
| TrustLLaVALLM=Vicuna-7B, Resolution=3362026.07 | 1,390.8 | |
| DINOv2LLM Backbone=Qwen2-7B2026.02 | 1,388.19 | |
| TokenPackerVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,388 | |
| Pixel-ShuffleVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,379 | |
| C-AbstractorVision Token=144, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 1,376 | |
| TokenFlow-LPretrained-LLM=Vicuna-13B, Model Category=Unified Model2026.02 | 1,365.4 | |
| VILA-UPretrained-LLM=LLaMA2-7B, Model Category=Unified Model2026.02 | 1,336.2 | |
| EVE-7B(HD)Pretrained-LLM=Vicuna-7B, Model Category=Unified Model2026.02 | 1,305.7 | |
| InternVL-ChatPretrained-LLM=Vicuna-7B, Model Category=Understanding Only Model2026.02 | 1,298.5 | |
| TrustLLaVA (MLP)LLM=Vicuna-7B, Resolution=3362026.07 | 1,296.8 | |
| mFRESALLM Backbone=Qwen2-7B2026.02 | 1,283.48 | |
| DINOv2LLM Backbone=Phi22026.02 | 1,279.21 | |
| FT-DINOSAURLLM Backbone=Qwen2-7B2026.02 | 1,242.25 | |
| StableLSDLLM Backbone=Qwen2-7B2026.02 | 1,239.48 | |
| VQDINO_MLPLLM Backbone=Qwen2-7B2026.02 | 1,229.43 | |
| DINOSAURv2LLM Backbone=Qwen2-7B2026.02 | 1,224.84 | |
| InstructBLIPPretrained-LLM=Vicuna-7B, Model Category=Understanding Only Model2026.02 | 1,212.8 | |
| mFRESALLM Backbone=Phi22026.02 | 1,187.05 | |
| DINOSAURLLM Backbone=Qwen2-7B2026.02 | 1,178.87 | |
| Slot DiffusionLLM Backbone=Qwen2-7B2026.02 | 1,171.83 | |
| SPOTLLM Backbone=Qwen2-7B2026.02 | 1,169.11 | |
| VQDINO_MLPLLM Backbone=Phi22026.02 | 1,167.08 | |
| HarmonPretrained-LLM=Qwen2.5-1.5B, Model Category=Unified Model2026.02 | 1,155 | |
| StableLSDLLM Backbone=Phi22026.02 | 1,129.08 | |
| DINOSAURv2LLM Backbone=Phi22026.02 | 1,122.73 | |
| Show-oPretrained-LLM=Phi-1.5-1.3B, Model Category=Unified Model2026.02 | 1,097.2 | |
| Slot DiffusionLLM Backbone=Phi22026.02 | 1,090.1 | |
| SPOTLLM Backbone=Phi22026.02 | 1,069.8 | |
| DINOSAURLLM Backbone=Phi22026.02 | 1,047.34 | |
| FT-DINOSAURLLM Backbone=Phi22026.02 | 1,004.94 | |
| Blind-VLMLLM Backbone=Qwen2-7B2026.02 | 686.29 | |
| Blind-VLMLLM Backbone=Phi22026.02 | 667.38 |