Multimodal Understanding on SEED-Bench Image (test)
75.9AccuracyInternLM-XComposer2
Evaluation Results
| Method | Links | |
|---|---|---|
| InternLM-XComposer2LLM=InternLM2-7B2024.01 | 75.9 | |
| LLaVA-XTunerLLM=InternLM2-20B2024.01 | 70.2 | |
| ShareGPT4V-7BLanguage Model=Vicuna-7B2023.11 | 69.7 | |
| ShareGPT4VLLM=Vicuna-7B2024.01 | 69.7 | |
| Monkey-10BLLM=Qwen-7B2024.01 | 68.9 | |
| CogVLM-17BLLM=Vicuna-7B2024.01 | 68.8 | |
| LLaVA-1.5Language Model=Vicuna-13B2023.11 | 68.2 | |
| LLaVA-1.5LLM=Vicuna-13B2024.01 | 68.2 | |
| LLaVA-1.5Language Model=Vicuna-7B2023.11 | 66.2 | |
| InternLM-XCLLM=InternLM-7B2024.01 | 66.1 | |
| Qwen-VL-ChatLanguage Model=Qwen-7B2023.11 | 58.2 | |
| Qwen-VL-ChatLLM=Qwen-7B2024.01 | 58.2 | |
| Qwen-VLLanguage Model=Qwen-7B2023.11 | 56.3 | |
| InstructBLIPLanguage Model=Vicuna-7B2023.11 | 53.4 | |
| InstructBLIPLLM=Vicuna-7B2024.01 | 53.4 | |
| IDEFICS-80BLLM=LLaMA-65B2024.01 | 52 | |
| BLIP-2Language Model=FLAN-T52023.11 | 46.4 | |
| BLIP-2LLM=FLAN-T52024.01 | 46.4 | |
| LLaVALanguage Model=Vicuna-7B2023.11 | 25.5 | |
| LLaVALLM=Vicuna-7B2024.01 | 25.5 |