Multimodal Benchmarking on MM-Bench 37
71.5AccuracyMipha-3B+ (Ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| Mipha-3B+ (Ours)LM=Phi-2 (2.7B), Res.=384, PT=558K, IT=665K2024.07 | 71.5 | |
| Mipha-3BLM=Phi-2 (2.7B), Res.=384, PT=558K, IT=665K2024.07 | 69.7 | |
| Bunny-3BLM=Phi-2 (2.7B), Res.=384, PT=2M, IT=695K2024.07 | 68.6 | |
| LLaVA-1.5+ (Ours)LM=Vicuna(7B), Res.=336, PT=558K, IT=665K2024.07 | 67.6 | |
| LAF-7BLM=Vicuna (7B), Res.=336, PT=558K, IT=665K2024.07 | 67.3 | |
| TinyLLaVALM=Phi-2 (2.7B), Res.=384, PT=1.2M, IT=665k2024.07 | 66.9 | |
| Imp-v1LM=Phi-2 (2.7B), Res.=384, PT=558K, IT=665K2024.07 | 66.5 | |
| mPLUG-Owl2LM=LLAMA (7B), Res.=448, PT=400M, IT=1.23M2024.07 | 64.5 | |
| LLaVA-1.5LM=Vicuna (7B), Res.=336, PT=558K, IT=665K2024.07 | 64.3 | |
| Mobile VLM-v2-3BLM=M-LLaMA (2.7B), Res.=336, PT=1.2M, IT=2.4M2024.07 | 63.2 | |
| Qwen-VL-ChatLM=Qwen (7B), Res.=448, PT=1.4B, IT=50M2024.07 | 60.6 | |
| LLaVA-PhiLM=Phi-2 (2.7B), Res.=336, PT=558k, IT=665K2024.07 | 59.8 | |
| Mobile VLM-3BLM=M-LLaMA (2.7B), Res.=336, PT=558K, IT=665K2024.07 | 59.6 | |
| ShikraLM=Vicuna (13B), Res.=224, PT=600K, IT=5.5M2024.07 | 58.8 | |
| Mobile VLM-v2-1.7BLM=M-LLaMA (1.4B), Res.=336, PT=1.2M, IT=2.4M2024.07 | 57.7 | |
| IDEFICS-80BLM=LLaMA (65B), Res.=224, PT=353M, IT=1M2024.07 | 54.5 | |
| Mobile VLM-1.7BLM=M-LLaMA (1.4B), Res.=336, PT=558K, IT=665K2024.07 | 53.2 | |
| IDEFICS-9BLM=LLaMA (7B), Res.=224, PT=353M, IT=1M2024.07 | 48.2 | |
| InstructBLIPLM=Vicuna (7B), Res.=224, PT=129M, IT=1.2M2024.07 | 36 |