Multimodal Understanding on MMBench v1.0 (test)
67.7AccuracyLLaVA-1.5
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5LLM=Vicuna-13B, PT=558K, IT=665K2024.03 | 67.7 | |
| LLaVA-1.5LLM=Vicuna-7B, PT=558K, IT=665K2024.03 | 64.3 | |
| Qwen-VL-ChatLLM=Qwen-7B, PT=1.4B, IT=50M2024.03 | 60.6 | |
| LLaVA-PhiLLM=Phi-2-2.7B, PT=558K, IT=665K2024.03 | 59.8 | |
| MobileVLM-3BLLM=MobileLLaMA-2.7B, PT=558K, IT=665K2024.03 | 59.6 | |
| ShikraLLM=Vicuna-13B, PT=600K, IT=5.5M2024.03 | 58.8 | |
| VL-MambaLLM=Mamba LLM-2.8B, PT=558K, IT=665K2024.03 | 57 | |
| IDEFICS-80BLLM=LLaMA-65B, PT=353M, IT=1M2024.03 | 54.5 | |
| mPLUG-OwlLLM=LLaMA-7B, PT=2.1M, IT=102K2024.03 | 49.4 | |
| OtterLLM=LLaMA-7B2024.03 | 48.3 | |
| IDEFICS-9BLLM=LLaMA-7B, PT=353M, IT=1M2024.03 | 48.2 | |
| Qwen-VLLLM=Qwen-7B, PT=1.4B, IT=50M2024.03 | 38.2 | |
| InstructBLIPLLM=Vicuna-7B, PT=129M, IT=1.2M2024.03 | 36 | |
| MiniGPT-4LLM=Vicuna-7B, PT=5M, IT=5K2024.03 | 23 |