Multi-modal Understanding on MMBench (dev)
80.6Overall ScoreMini-Gemini-HD
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Mini-Gemini-HDLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 80.6 | — | — | — | — | — | — | |
| Mini-GeminiLLM=Hermes-2-Yi-34B, Resolution=336, Zero-shot=true2024.03 | 79.6 | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Hermes-2-Yi-34B, Resolution=672, Zero-shot=true2024.03 | 79.6 | — | — | — | — | — | — | |
| Mini-GeminiLLM=Mixtral-8x7B, Resolution=336, Zero-shot=true2024.03 | 75.6 | — | — | — | — | — | — | |
| Gemini ProLLM=Private, Zero-shot=true2024.03 | 75.2 | — | — | — | — | — | — | |
| GPT-4VLLM=Private, Zero-shot=true2024.03 | 75.1 | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Mixtral-8x7B, Resolution=672, Zero-shot=true2024.03 | 74.7 | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 70.7 | — | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 69.3 | — | — | — | — | — | — | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 69.2 | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-13B, Resolution=672, Zero-shot=true2024.03 | 68.6 | — | — | — | — | — | — | |
| Mini-GeminiLLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 68.5 | — | — | — | — | — | — | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 68.1 | — | — | — | — | — | — | |
| LLaMA-VIDLLM=Vicuna-13B, Resolution=336, Zero-shot=true2024.03 | 66.6 | — | — | — | — | — | — | |
| Qwen-VL-PlusLLM=Private, Zero-shot=true2024.03 | 66.2 | — | — | — | — | — | — | |
| Mini-Gemini-HDLLM=Vicuna-7B, Resolution=672, Zero-shot=true2024.03 | 65.8 | — | — | — | — | — | — | |
| MMICLLanguage Model=FLAN-T5-XXL, Vision Model=EVA-G2023.09 | 65.24 | 44.32 | 77.85 | 64.78 | 66.5 | 53.6 | 70.64 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 65.2 | — | — | — | — | — | — | |
| LLaMA-VIDLLM=Vicuna-7B, Resolution=336, Zero-shot=true2024.03 | 65.1 | — | — | — | — | — | — | |
| JiuTianLanguage Model=FLANT5-XXL, Vision Model=EVA-G2023.09 | 64.7 | 46.6 | 76.5 | 66.7 | 66.5 | 51.6 | 68.7 | |
| CogVLM-ChatLLM=Vicuna-7B, Resolution=490, Zero-shot=true2024.03 | 63.7 | — | — | — | — | — | — | |
| mPLUG-OwlLanguage Model=LLaMA-7B, Vision Model=CLIP ViT-L/142023.09 | 62.3 | 37.5 | 75.4 | 56.8 | 67.3 | 52.4 | 67.2 | |
| LMEyeLanguage Model=Flan-XL, Vision Model=CLIP ViT-L/142023.09 | 61.3 | 36.9 | 73 | 55.4 | 60 | 68 | 68.9 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=448, Zero-shot=true2024.03 | 60.6 | — | — | — | — | — | — | |
| ShikraLanguage Model=Vincuna-7B, Vision Model=CLIP ViT-L/142023.09 | 60.2 | 33.5 | 69.6 | 53.1 | 61.8 | 50.4 | 71.7 | |
| Mini-GeminiLLM=Gemma-2B, Resolution=336, Zero-shot=true2024.03 | 59.8 | — | — | — | — | — | — | |
| MobileVLMLLM=MiLAMA 2.7B, Resolution=336, Zero-shot=true2024.03 | 59.6 | — | — | — | — | — | — | |
| ShikraLLM=Vicuna-13B, Resolution=224, Zero-shot=true2024.03 | 58.8 | — | — | — | — | — | — | |
| IDEFICS-80BLLM=LLaMA-65B, Resolution=224, Zero-shot=true2024.03 | 54.5 | — | — | — | — | — | — | |
| OtterHDLLM=Fuyu-8B, Resolution=1024, Zero-shot=true2024.03 | 53.6 | — | — | — | — | — | — | |
| Otter-ILanguage Model=LLaMA-7B, Vision Model=CLIP ViT-L/142023.09 | 48.3 | 22.2 | 63.3 | 39.4 | 46.8 | 36.4 | 60.6 | |
| G2PTLanguage Model=LLaMA-7B, Vision Model=ViT-G2023.09 | 39.8 | 14.8 | 46.7 | 31.5 | 41.8 | 34.4 | 49.8 | |
| Qwen-VL+LLM=Qwen-7B, Resolution=448, Zero-shot=true2024.03 | 38.2 | — | — | — | — | — | — | |
| LLaVALanguage Model=LLaMA-7B, Vision Model=CLIP ViT-L/142023.09 | 36.2 | 15.9 | 53.6 | 28.6 | 41.8 | 20 | 40.4 | |
| InstructBLIPLLM=Vicuna-7B, Resolution=224, Zero-shot=true2024.03 | 36 | — | — | — | — | — | — | |
| InstructBLIPLanguage Model=Vincuna-7B, Vision Model=EVA-G2023.09 | 33.9 | 21.6 | 47.4 | 22.5 | 33 | 24.4 | 41.1 | |
| VisualGLMLanguage Model=ChatGLM-6B, Vision Model=EVA-CLIP2023.09 | 33.5 | 11.4 | 48.8 | 27.7 | 35.8 | 17.6 | 41.5 | |
| PandaGPTLanguage Model=Vincuna-13B, Vision Model=ImageBind ViT-H/142023.09 | 30.6 | 15.3 | 41.5 | 22 | 20.3 | 20.4 | 47.9 | |
| MMGPTLanguage Model=LLaMA-7B, Vision Model=CLIP ViT-L/142023.09 | 16 | 1.1 | 23.8 | 20.7 | 18.3 | 5.2 | 18.3 | |
| MiniGPT-4Language Model=Vincuna-7B, Vision Model=EVA-G2023.09 | 12 | 13.6 | 32.9 | 8.9 | 28.8 | 11.2 | 28.3 |