Large Multimodal Model Evaluation on MM-Vet
54.5Average ScoreCogVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| CogVLMNumber of Parameters=17B, Setting=Zero-shot2024.02 | 54.5 | |
| CogVLMZero-shot=true, Number of Parameters=17B2024.03 | 54.5 | |
| Emu2-Chataverage of five scoring runs=true2023.12 | 48.5 | |
| Imp-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 44.6 | |
| MoAIZero-shot=true, Number of Parameters=7B2024.03 | 43.7 | |
| Imp-3BLLM=Phi-2-2.7B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 43.3 | |
| CoLLaVONumber of Parameters=7B, Setting=Zero-shot2024.02 | 40.3 | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 39.4 | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 38.3 | |
| ShareGPT4VNumber of Parameters=7B, Setting=Zero-shot2024.02 | 37.6 | |
| ShareGPT4VZero-shot=true, Number of Parameters=7B2024.03 | 37.6 | |
| LLaVA-XTunerNumber of Parameters=20B, Setting=Zero-shot2024.02 | 37.2 | |
| LLaVA-XTunerZero-shot=true, Number of Parameters=20B2024.03 | 37.2 | |
| Emu-Iaverage of five scoring runs=true2023.12 | 36.3 | |
| mPLUG-Owl2Number of Parameters=7B, Setting=Zero-shot2024.02 | 36.2 | |
| mPLUG-Owl2-8BLLM=LLAMA2-7B, Visual Encoder=CLIP-L@448, #PT=400M, #FT=1.2M2024.05 | 36.2 | |
| mPLUG-Owl2Zero-shot=true, Number of Parameters=7B2024.03 | 36.2 | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 36.1 | |
| LLaVA-1.5-13Baverage of five scoring runs=true2023.12 | 35.4 | |
| LLaVA1.5Number of Parameters=13B, Setting=Zero-shot2024.02 | 35.4 | |
| LLaVA1.5Zero-shot=true, Number of Parameters=13B2024.03 | 35.4 | |
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 35.4 | |
| Intern-XCNumber of Parameters=7B, Setting=Zero-shot2024.02 | 35.2 | |
| Intern-XCZero-shot=true, Number of Parameters=7B2024.03 | 35.2 | |
| Merlin2023.11 | 34.9 | |
| APTBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 34.7 | |
| ResizingBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 33.9 | |
| Imp-2BLLM=Qwen-1.5-1.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 33.5 | |
| CLASPToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 33.3 | |
| RandomBase Model=LLaVA-1.5-13B, Img/s=2.79, Speedup=+26%2025.10 | 32 | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 31.1 | |
| Mini-Gemini-2BLLM=Gemma-2B, Visual Encoder=CLIP-L@336, #PT=1.2M, #FT=1.5M2024.05 | 31.1 | |
| APTBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 30.8 | |
| LLaVA-1.5-7BImg/s=3.70, Speedup=-2025.10 | 30.7 | |
| LLaVA1.5Number of Parameters=7B, Setting=Zero-shot2024.02 | 30.5 | |
| LLaVA-1.52023.11 | 30.5 | |
| LLaVA1.5Zero-shot=true, Number of Parameters=7B2024.03 | 30.5 | |
| NuwaToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 30.5 | |
| RandomBase Model=LLaVA-1.5-7B, Img/s=4.58, Speedup=+24%2025.10 | 30.5 | |
| LLaVA-1.5-7BLLM=Vicuna-1.5-7B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 30.2 | |
| ResizingBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 30.2 | |
| BTPToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 29.1 | |
| LLaVA-Phi-3BLLM=Phi-2-2.7B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 28.9 | |
| LLaVANumber of Parameters=7B, Setting=Zero-shot2024.02 | 26.7 | |
| LLaVAZero-shot=true, Number of Parameters=7B2024.03 | 26.7 | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 26.2 | |
| InstructBLIPNumber of Parameters=7B, Setting=Zero-shot2024.02 | 26.2 | |
| InstructBLIP2023.11 | 26.2 | |
| InstructBLIPZero-shot=true, Number of Parameters=7B2024.03 | 26.2 | |
| InstructBLIP-13Baverage of five scoring runs=true2023.12 | 25.6 | |
| InstructBLIP-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 25.6 | |
| InstructBLIPNumber of Parameters=13B, Setting=Zero-shot2024.02 | 25.6 | |
| InstructBLIPZero-shot=true, Number of Parameters=13B2024.03 | 25.6 | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 25.5 | |
| OtterNumber of Parameters=7B, Setting=Zero-shot2024.02 | 24.6 | |
| OtterZero-shot=true, Number of Parameters=7B2024.03 | 24.6 | |
| MIXTraining Dataset=MIX2023.09 | 23.9 | |
| LLaVATraining Dataset=LLaVA (2023b)2023.09 | 23.4 | |
| BLIP-2-13Baverage of five scoring runs=true2023.12 | 22.4 | |
| BLIP2-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M2023.10 | 22.4 | |
| BLIP2Number of Parameters=13B, Setting=Zero-shot2024.02 | 22.4 | |
| BLIP-22023.11 | 22.4 | |
| BLIP2Zero-shot=true, Number of Parameters=13B2024.03 | 22.4 | |
| MiniGPT-4Number of Parameters=7B, Setting=Zero-shot2024.02 | 22.1 | |
| MiniGPT-4Zero-shot=true, Number of Parameters=7B2024.03 | 22.1 | |
| ShikraTraining Dataset=Shikra (2023a)2023.09 | 19.9 | |
| TEXTBINDTraining Dataset=TEXTBIND2023.09 | 19.4 | |
| MultiInstructTraining Dataset=MultiInstruct (2023b)2023.09 | 17.2 | |
| MiniGPT-4Training Dataset=MiniGPT-4 (2023)2023.09 | 9.8 |