Multimodal Understanding on MM-VET (test)
67.6Total ScoreGPT-4V
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4VLLM=Private, Zero-shot=true2024.03 | 67.6 | — | — | — | — | — | — | — | — | |
| BAGELParams=14.0B2025.09 | 67.2 | — | — | — | — | — | — | — | — | |
| Unified-IO2LLM=UIO-2XXL2023.11 | 65.6 | — | — | — | — | — | — | — | — | |
| Qwen-VL-ChatLLM=Qwen-7B2023.11 | 65.4 | — | — | — | — | — | — | — | — | |
| Gemini ProLLM=Private, Zero-shot=true2024.03 | 64.3 | — | — | — | — | — | — | — | — | |
| MetaQuery-LParams=3.0B | 3.2B2025.09 | 63.2 | — | — | — | — | — | — | — | — | |
| DIM-4.6B-T2I/EditParams=3.0B | 1.6B2025.09 | 63.2 | — | — | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 59.3 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=1.2M+1.5M, Res.=384 AnyRes, LLM=Yi-34B2024.05 | 59.2 | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 57.4 | — | — | — | — | — | — | — | — | |
| InternVL-2-8BBackbone=InternVL-2-8B2026.01 | 53.6 | — | — | — | — | — | — | — | 602.8 | |
| Mini-Gemini-HDLLM=Mixtral-8x7B, Resolution=672, Zero-shot=true2024.03 | 53.5 | — | — | — | — | — | — | — | — | |
| InternVL-2-26BBackbone=InternVL-2-26B2026.01 | 53.1 | — | — | — | — | — | — | — | 600.1 | |
| Mini-GeminiLLM=Hermes-2-Yi-34B, Resolution=336, Zero-shot=true2024.03 | 53 | — | — | — | — | — | — | — | — | |
| CogVLM-ChatLLM=Vicuna-7B2023.11 | 51.1 | — | — | — | — | — | — | — | — | |
| CogVLM-ChatLLM=Vicuna-7B, Resolution=490, Zero-shot=true2024.03 | 51.1 | — | — | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 50.5 | — | — | — | — | — | — | — | — | |
| Janus-Pro-7BParams=7.0B2025.09 | 50 | — | — | — | — | — | — | — | — | |
| Emu2-ChatLLM=LLaMA-33B2023.11 | 48.5 | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 48.4 | — | — | — | — | — | — | — | — | |
| LLaVA-NeXTPT+IT=0.5M+0.7M, Res.=336 AnyRes, LLM=Vicuna-13B2024.05 | 48.4 | — | — | — | — | — | — | — | — | |
| SPHINX-PlusPT+IT=16M, Res.=448, LLM=Llama2-13B2024.05 | 47.9 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=1.2M+1.5M, Res.=384, LLM=Vicuna-13B2024.05 | 47.8 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=1.2M+1.5M, Res.=384 AnyRes, LLM=Vicuna-13B2024.05 | 47 | — | — | — | — | — | — | — | — | |
| IXC-2.5-7BBackbone=IXC-2.5-7B2026.01 | 46.3 | — | — | — | — | — | — | — | 380.1 | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Llama3-70B LORA2024.05 | 46.1 | — | — | — | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 46 | — | — | — | — | — | — | — | — | |
| Mini-GeminiPT+IT=1.2M+1.5M, Res.=336+768, LLM=Vicuna-13B2024.05 | 46 | — | — | — | — | — | — | — | — | |
| Mini-GeminiLLM=Mixtral-8x7B, Resolution=336, Zero-shot=true2024.03 | 45.8 | — | — | — | — | — | — | — | — | |
| MM-ReAct-GPT-4System backbone=GPT-42023.09 | 44.6 | 33.1 | 65.7 | 29 | 35 | 56.8 | 69.2 | — | — | |
| Dense ConnectorPT+IT=1.2M+1.5M, Res.=384 AnyRes, LLM=Vicuna-7B2024.05 | 44.4 | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7BBackbone=LLaVA-OV-7B2026.01 | 44.1 | — | — | — | — | — | — | — | 556.2 | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 43.9 | — | — | — | — | — | — | — | — | |
| CLIBackbone=LLaVA-OV-7B2026.01 | 43.8 | — | — | — | — | — | — | — | 559.4 | |
| ShareGPT4VPT+IT=1.2M+0.7M, Res.=336, LLM=Vicuna-13B2024.05 | 43.1 | — | — | — | — | — | — | — | — | |
| MM1PT+IT=3B+1.4M, Res.=1344, LLM=MM1-7B2024.05 | 42.1 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Vicuna-13B2024.05 | 41.6 | — | — | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 41.3 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Yi-34B LORA2024.05 | 41 | — | — | — | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 40.8 | — | — | — | — | — | — | — | — | |
| SLIBackbone=LLaVA-OV-7B2026.01 | 40.6 | — | — | — | — | — | — | — | 551.1 | |
| DeepStackBackbone=LLaVA-OV-7B2026.01 | 40.3 | — | — | — | — | — | — | — | 539.3 | |
| SPHINX-2kLLM=LLaMA2 13B2023.11 | 40.2 | — | — | — | — | — | — | — | — | |
| IDEFICS-InstructLLM=LLaMA-65B2023.11 | 39.7 | — | — | — | — | — | — | — | — | |
| VILAPT+IT=50M+1M, Res.=336, LLM=Llama-2-13B2024.05 | 38.8 | — | — | — | — | — | — | — | — | |
| ShareGPT4V-7BLanguage Model=Vicuna-7B2023.11 | 37.6 | — | — | — | — | — | — | — | — | |
| Emu3-GenParams=8.0B2025.09 | 37.2 | — | — | — | — | — | — | — | — | |
| LLaVA-65BNumber of parameters=65B, Data Mixing=true, Protocol=Own experiment run2023.09 | 36.4 | 41.8 | 27.9 | 30.4 | 32.3 | 30.5 | 7.3 | — | — | |
| Vary-baseLLM=qwen7B, SFT data=80k2023.12 | 36.2 | 38.9 | 30.1 | 22.4 | 21.7 | 34.3 | 7.7 | — | — | |
| mPLUG-Owl2LLM=LLaMA2-7B2023.11 | 36.2 | — | — | — | — | — | — | — | — | |
| mPLUG-Owl2PT+IT=348M+1.2M, Res.=448, LLM=Llama2-7B2024.05 | 36.2 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 36.1 | — | — | — | — | — | — | — | — | |
| LLaVA-v1.5PT+IT=0.5M+0.6M, Res.=336, LLM=Vicuna-13B2024.05 | 36.1 | — | — | — | — | — | — | — | — | |
| DreamLLMLLM=Vicuna-7B2023.11 | 35.9 | — | — | — | — | — | — | — | — | |
| LLaVA-65BNumber of parameters=65B, Protocol=Own experiment run2023.09 | 35.5 | 39.2 | 28.2 | 26.2 | 28.3 | 33 | 15 | — | — | |
| LLaVA-1.5Language Model=Vicuna-13B2023.11 | 35.4 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B2023.11 | 35.4 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Vicuna-7B2024.05 | 35.4 | — | — | — | — | — | — | — | — | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Llama3-8B2024.05 | 34.6 | — | — | — | — | — | — | — | — | |
| Dense ConnectorResolution=336, Tokens=144, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 34.4 | — | — | — | — | — | — | — | — | |
| CuMoPT+IT=0.5M+0.6M, Res.=336, LLM=Mistral-7B2024.05 | 34.3 | — | — | — | — | — | — | — | — | |
| JanusParams=1.3B2025.09 | 34.3 | — | — | — | — | — | — | — | — | |
| LLaVA-33BNumber of parameters=33B, Data Mixing=true, Protocol=Own experiment run2023.09 | 34.1 | 37.7 | 27.1 | 26.2 | 28.6 | 28.1 | 11.5 | — | — | |
| Dense ConnectorPT+IT=0.5M+0.6M, Res.=384, LLM=Phi2-2.7B2024.05 | 33.8 | — | — | — | — | — | — | — | — | |
| TokenPackerResolution=336, Tokens=144, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 33 | — | — | — | — | — | — | — | — | |
| LLaVA-13B (LLaMA-2)Backbone=LLaMA-2, Number of parameters=13B2023.09 | 32.9 | 39.2 | 22.7 | 26.5 | 29.3 | 29.6 | 7.7 | — | — | |
| LLaVA-33BNumber of parameters=33B, Protocol=Own experiment run2023.09 | 32.9 | 38.5 | 25 | 26.2 | 28.2 | 29.2 | 7.7 | — | — | |
| LLaVA-13B2023.12 | 32.9 | 39.2 | 22.7 | 26.5 | 29.3 | 29.6 | 7.7 | — | — | |
| Vary-baseLLM=vicuna7B, SFT data=665k2023.12 | 32.9 | 38.7 | 22 | 23.6 | 24.1 | 29.6 | 7.7 | — | — | |
| LLaVA-13B (LLaMA-2)Backbone=LLaMA-2, Number of parameters=13B, Protocol=Own experiment run2023.09 | 32.6 | 38.4 | 21 | 26.3 | 28.8 | 28 | 7.7 | — | — | |
| LLaVA-13B (V1.3, 336px)Model Version=V1.3, Input Resolution=336px, Number of parameters=13B2023.09 | 32.5 | 38.1 | 22.3 | 25.2 | 25.8 | 31.3 | 11.2 | — | — | |
| TinyLLaVAPT+IT=0.5M+0.6M, Res.=384, LLM=Phi2-2.7B2024.05 | 32.1 | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 31.7 | — | — | — | — | — | — | 101.9 | — | |
| VILA-13BBackbone=VILA-13B2026.01 | 31.2 | — | — | — | — | — | — | — | 396.2 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 31.1 | — | — | — | — | — | — | — | — | |
| Mini-GeminiLLM=Gemma-2B, Resolution=336, Zero-shot=true2024.03 | 31.1 | — | — | — | — | — | — | — | — | |
| LLaVAResolution=336, Tokens=576, PT+IT=0.5M+0.6M, LLM=Vicuna-7B2024.05 | 31.1 | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA1.5-7B, Pruning Family=Baseline2026.02 | 31.1 | — | — | — | — | — | — | 100 | — | |
| LLaVA-1.5Language Model=Vicuna-7B2023.11 | 30.5 | — | — | — | — | — | — | — | — | |
| LLaVA1.5-7B2023.12 | 30.5 | — | — | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-7B2023.11 | 30.5 | — | — | — | — | — | — | — | — | |
| LLaVA-7B (LLaMA-2)Backbone=LLaMA-2, Number of parameters=7B2023.09 | 28.1 | 32.9 | 20.1 | 19 | 20.1 | 25.7 | 5.2 | — | — | |
| PruMerge+Base Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 28 | — | — | — | — | — | — | 90 | — | |
| LLaVA-OV-0.5BBackbone=LLaVA-OV-0.5B2026.01 | 28 | — | — | — | — | — | — | — | 391 | |
| MM-ReAct-GPT-3.5System backbone=GPT-3.52023.09 | 27.9 | 24.2 | 31.5 | 21.5 | 20.7 | 32.3 | 26.2 | — | — | |
| CLIBackbone=LLaVA-OV-0.5B2026.01 | 27 | — | — | — | — | — | — | — | 395.6 | |
| LLaVALanguage Model=Vicuna-7B2023.11 | 26.7 | — | — | — | — | — | — | — | — | |
| LLaVA-13BNumber of parameters=13B2023.09 | 26.4 | 30.9 | 20.1 | 23.5 | 26.4 | 24.3 | 7.7 | — | — | |
| InstructBLIP-8BNumber of parameters=8B2023.09 | 26.2 | 32.4 | 14.6 | 16.5 | 18.2 | 18.6 | 7.7 | — | — | |
| InstructBLIPLanguage Model=Vicuna-7B2023.11 | 26.2 | — | — | — | — | — | — | — | — | |
| InstructBLIPLLM=Vicuna-7B2023.11 | 26.2 | — | — | — | — | — | — | — | — | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Zero-shot=true2024.03 | 26.2 | — | — | — | — | — | — | — | — | |
| SLIBackbone=LLaVA-OV-0.5B2026.01 | 26.1 | — | — | — | — | — | — | — | 393.7 | |
| InstructBLIP-14BNumber of parameters=14B2023.09 | 25.6 | 30.8 | 16 | 9.8 | 9 | 21.1 | 10.5 | — | — | |
| InstructBLIPLanguage Model=FLAN-T52023.11 | 25.6 | — | — | — | — | — | — | — | — | |
| InstructBLIPLLM=Vicuna-13B, Resolution=224, Zero-shot=true2024.03 | 25.6 | — | — | — | — | — | — | — | — | |
| PDropBase Model=LLaVA1.5-7B, Pruning Family=LLM Multi-Layer Pruning2026.02 | 24.9 | — | — | — | — | — | — | 80.1 | — | |
| SparseVLMBase Model=LLaVA1.5-7B, Pruning Family=LLM Multi-Layer Pruning2026.02 | 24.9 | — | — | — | — | — | — | 80.1 | — | |
| OpenFlamingo2023.12 | 24.8 | 28.7 | 16.7 | 16.4 | 13.1 | 21 | 7.7 | — | — | |
| OpenFlamingoLLM=MPT-7B2023.11 | 24.8 | — | — | — | — | — | — | — | — |