Multi-modal Benchmark on MMBench (dev)
73.5AccuracyBunny-4B
Evaluation Results
| Method | Links | |
|---|---|---|
| Bunny-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=2M, #FT=695K2024.05 | 73.5 | |
| Imp-4BLLM=Phi-3-3.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 73.3 | |
| Imp-3BLLM=Phi-2-2.7B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 72.9 | |
| Bunny-3BLLM=Phi-2-2.7B, Visual Encoder=SigLIP-SO@384, #PT=2M, #FT=695K2024.05 | 68.6 | |
| LLaVA-1.5-13BLLM=Vicuna-1.5-13B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 68.5 | |
| Yi-VL-6BLLM=Yi-6B, Visual Encoder=CLIP-H@224, #PT=100M, #FT=26M2024.05 | 68.4 | |
| MiniCPM-V-3BLLM=MiniCPM-SFT-2B, Visual Encoder=SigLIP-SO@384, #PT=300M, #FT=8M2024.05 | 67.9 | |
| LLaVA-1.5-7BLLM=Vicuna-1.5-7B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 66.1 | |
| mPLUG-Owl2-8BLLM=LLAMA2-7B, Visual Encoder=CLIP-L@448, #PT=400M, #FT=1.2M2024.05 | 64.5 | |
| Imp-2BLLM=Qwen-1.5-1.8B, Visual Encoder=SigLIP-SO@384, #PT=558K, #FT=1M2024.05 | 63.8 | |
| LLaVA-Phi-3BLLM=Phi-2-2.7B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 59.8 | |
| Mini-Gemini-2BLLM=Gemma-2B, Visual Encoder=CLIP-L@336, #PT=1.2M, #FT=1.5M2024.05 | 59.8 | |
| MobileVLM-3BLLM=MobileLLaMA-2.7B, Visual Encoder=CLIP-L@336, #PT=558K, #FT=665K2024.05 | 59.6 | |
| Bunny-2BLLM=Qwen1.5-1.8B, Visual Encoder=SigLIP-SO@384, #PT=2M, #FT=695K2024.05 | 59.1 | |
| SPHINX-X-8BLLM=InternLM2-7B, Visual Encoder=CLIP&Dino@224, #PT=0, #FT=15M2024.05 | 57.9 |