Multi-modal Perception on MMBench (dev)
69.2MMB Score (dev)MobileVLM V2 7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MobileVLM V2 7BLLM=Vicuna-7B, #Samples=3.6M2024.12 | 69.2 | 72.2 | |
| ShareGPT4VLLM=Vicuna-7B, #Samples=1.9M2024.12 | 68.8 | 70.8 | |
| MoE-LLaVA-2.7B×4LLM=Phi-2.7B, #Samples=2.2M2024.12 | 65.5 | 66.7 | |
| LLaVA-1.5LLM=Vicuna-7B, #Samples=1.2M2024.12 | 64.3 | 68.8 | |
| MobileVLM V2 3BLLM=MobileLLaMA 2.7B, #Samples=3.6M2024.12 | 63.2 | 68.1 | |
| MobileVLM 3BLLM=MobileLLaMA 2.7B, #Samples=3.6M2024.12 | 59.6 | 62.8 | |
| MoE-LLaVA-1.6B×4LLM=StableLM-1.6B, #Samples=2.2M2024.12 | 59.4 | 63.3 | |
| MobileVLM V2 1.7BSubset=Short, #Samples=3.6M, Align-KD=true2024.12 | 57.8 | 64.4 | |
| MobileVLM V2 1.7BSubset=Short, #Samples=3.6M, Align-KD=false2024.12 | 57.6 | 62.4 | |
| MobileVLM V2 1.7BSubset=Long, #Samples=3.6M, Align-KD=true2024.12 | 57.5 | 65.1 | |
| MobileVLM V2 1.7BSubset=Long, #Samples=3.6M, Align-KD=false2024.12 | 55.9 | 63.7 | |
| MobileVLM 1.7BLLM=MobileLLaMA 1.4B, #Samples=3.6M2024.12 | 53.2 | 58.7 | |
| MiniGPT-4LLM=Vicuna-7B, #Samples=5.0M2024.12 | 23 | — |