Multi-modal Perception on MME Perception
1,567.4MME^P ScoreShareGPT4V
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ShareGPT4VLLM=Vicuna-7B, #Samples=1.9M2024.12 | 1,567.4 | 70.8 | |
| MobileVLM V2 7BLLM=Vicuna-7B, #Samples=3.6M2024.12 | 1,559 | 72.2 | |
| LLaVA-1.5LLM=Vicuna-7B, #Samples=1.2M2024.12 | 1,510.7 | 68.8 | |
| MobileVLM V2 3BLLM=MobileLLaMA 2.7B, #Samples=3.6M2024.12 | 1,440.5 | 68.1 | |
| MoE-LLaVA-2.7B×4LLM=Phi-2.7B, #Samples=2.2M2024.12 | 1,396.4 | 66.7 | |
| MobileVLM V2 1.7BSubset=Long, #Samples=3.6M, Align-KD=true2024.12 | 1,303.8 | 65.1 | |
| MoE-LLaVA-1.6B×4LLM=StableLM-1.6B, #Samples=2.2M2024.12 | 1,300.8 | 63.3 | |
| MobileVLM V2 1.7BSubset=Long, #Samples=3.6M, Align-KD=false2024.12 | 1,289.2 | 63.7 | |
| MobileVLM 3BLLM=MobileLLaMA 2.7B, #Samples=3.6M2024.12 | 1,288.9 | 62.8 | |
| MobileVLM V2 1.7BSubset=Short, #Samples=3.6M, Align-KD=true2024.12 | 1,288.4 | 64.4 | |
| MobileVLM V2 1.7BSubset=Short, #Samples=3.6M, Align-KD=false2024.12 | 1,246.3 | 62.4 | |
| MobileVLM 1.7BLLM=MobileLLaMA 1.4B, #Samples=3.6M2024.12 | 1,196.2 | 58.7 | |
| MiniGPT-4LLM=Vicuna-7B, #Samples=5.0M2024.12 | 581.7 | — |